NeFut Logo NeFut
EN 管理员登录

[AI学术] 什么因素影响激进解码时 KV 驱逐?时间聚合与排序保持

发布于:2026-09-04 22:00 最后更新:2026-09-05 12:23
#AI #Machine Learning #LLM

解码时 KV 缓存压缩的研究往往聚焦于设计更好的 token 打分函数,而跨解码步的时间聚合规则常被视作实现细节。我们在激进的 KV 压缩场景下发现,指数移动平均(EMA)聚合能够使近似保持排序的打分器改动在驱逐集合层面几乎不可区分。具体而言,基于值范数(value‑norm)和熵的变体仍然与注意力高度相关,保留集合几乎不变;而 KeyDiff、键范数、最近性以及学习型打分器会显著改变排序并导致性能下降。我们将这种稳定性归因于所使用的聚合方式,它将层权重与时间保留耦合在一起。基于此观察,我们提出了 InertiaKV——一种基于 EMA 的解码时驱逐方法,以及其周期性刷新变体 InertiaKV‑Lazy,后者在相同硬件上实现了比完整刷新 InertiaKV 高出 1.34‑1.46 倍的解码吞吐。我们还单独研究了 Score‑Free 解码:在首次解码步对完整上下文进行一次打分并冻结排序,随后不再进行打分,平均质量提升 $+0.03$,且完全去除了后续打分开销。实验在六种开源模型以及 LongBench、LongBench‑v2、RULER 基准上进行,结果表明时间聚合和排序保持是两个独立且重要的设计因素,但并不意味着打分质量在所有情况下都可以忽略。

点评

原文链接: https://arxiv.org/abs/2609.03515

[h] 返回首页