NeFut Logo NeFut
EN 管理员登录

[AI学术] 自适应过滤KV缓存:诊断与纠正LLM推理中的结构角色偏差

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:19
#algorithm #optimization #C++

在基于注意力的KV缓存驱逐(H2O及其后代)中,通过对累积注意力质量进行排名,压缩了长上下文模型的内存受限状态。这一过程将注意力质量视为信号能量,并保留能量最大的标记。然而,在如嵌套JSON等结构密集的输入流中,这一评分作为非平稳过滤器,过度保留了噪声:非内容的角色(如分隔符或空格)携带的能量比任何内容角色高出一个数量级,结构关键(KEY)标记的保留率约为答案携带(VALUE)标记的1.8倍,导致在5%预算下准确率从88%降至0%。

通过反事实实验发现,抑制KEY标记是最佳的可部署过滤器。我们在SnapKV的窗口评分上进行无重训练的角色条件分配,仅通过一个调优超参数,能够在低于20%的预算下关闭63-98%的H2O差距,并且在较高预算下,准确率与全缓存持平或略有超出。这种小型、对种子敏感的去噪效果在B=0.50时接近显著;而在B=0.30时,四个种子间未能区分与零的差异。一个15MB的线性角色探测器以微不足道的推理成本提供这些标签,尽管与解析器级下游准确率的匹配仍需进一步探索。

博主点评: 本文提出了针对LLM推理中结构角色偏差的有效解决方案,通过自适应过滤机制显著提升了模型的准确性。关键在于对KV缓存的优化,尤其是对噪声的抑制,为未来的长上下文处理提供了新的思路和方法。整体来看,这项研究为高效利用内存资源和提升模型性能提供了重要的参考价值。

原文链接: https://arxiv.org/abs/2607.13205

[h] 返回首页