NeFut Logo NeFut
EN 管理员登录

[AI学术] 缓存感知的提示压缩:LLM API 缓存的双层成本模型

发布于:2026-07-20 22:00 最后更新:2026-07-22 01:02
#algorithm #optimization #C++

在生产环境中,LLM 部署结合了两种成本降低原理:提示缓存(对重复使用的 token 前缀给予折扣)和提示压缩(减少发送的 token 数量)。压缩文献标准化了查询感知的方法,这种方法为每个查询生成不同的压缩前缀,从而在每次调用时机械性地使前缀严格缓存失效。

我们在 Anthropic 的 Sonnet 4.6 API 上对这一成本进行了实证分析,发现缓存的表现远未达到文献假设的理想状态 rho=1.0:Sonnet 的缓存采用了双层架构,在 3500 个 token 附近有一个明显的阈值,低于该阈值时,命中率在 30 次调用会话中稳定在 rho~0.83。

我们的成本模型预测,并且实验确认,在现实的 rho 条件下,查询感知压缩在高压缩比(r = 6)时优于简单缓存。我们提出了缓存感知提示压缩(CAPC),将查询无关的压缩与显式的缓存控制相结合,并设置了一个保持层级的比率上限,以防止过度压缩将缓存前缀推入热层。

CAPC 在 LongBench-v2 的 16/16 配置中是最经济的策略,平均节省 49% 的成本,相较于仅缓存节省 64%,相较于查询感知压缩节省 90%,并且质量在与未压缩基准相差 0.05 之内。

我们在三个生产工作负载上验证了 CAPC:一个使用 94k token schema 前缀的企业工具助手(在 r=3 时节省 51.7% 成本);一个跨两个代码库的图形知识图谱 RAG 管道(在 FastAPI 上节省 9.3 倍,相较于缓存所有,httpx 上节省 2.4 倍);以及公共 tau-bench 零售基准(50 个任务),其中 CAPC 是四种策略中最便宜的,奖励与普通模式完全相同(两者均为 36/50,p=1.00),而查询感知压缩则是最昂贵的,比普通模式多 40.1% 的成本,这是公共基准上首次确认交叉模型的负 ROI 预测。

博主点评: 通过将查询无关的压缩与缓存控制结合,CAPC 提供了一种高效的压缩策略,显著降低了使用成本,尤其是在高压缩比的情况下。这种方法不仅在理论上具有优势,实际应用中也展现出显著的成本效益,值得在更多生产环境中推广应用。

原文链接: https://arxiv.org/abs/2607.15516

[h] 返回首页