NeFut Logo NeFut
EN 管理员登录

[AI学术] 连续性而非重要性:文档编辑后预算限制的 KV 缓存修复

发布于:2026-09-17 22:00 最后更新:2026-09-18 00:46
#AI #Machine Learning #LLM

KV 缓存复用能够显著降低检索增强生成(RAG)和代理系统的推理成本,但当检索到的知识、工作记忆或用户状态被编辑后,缓存的上下文会变得陈旧。由于因果自注意力的特性,即使是局部编辑也会影响后续的 KV 状态。完整的重新前填(full re‑prefill)可以可靠地恢复一致性,却代价高昂;仅刷新被编辑的跨度则可能留下下游依赖的陈旧。

我们将就地修复视为预算受限的重新计算问题,并在一个包含直接编辑和派生编辑的事实 RAG 基准上比较了多种无需训练的位置信息选择策略。实验覆盖三类模型家族,所有策略都能修复直接编辑的情况,但在派生编辑上表现分化。以主要预算下的连续编辑局部窗口为例,能够恢复至少 0.94 的编辑后答案差距,显著优于基于注意力、KV 偏差和结构选择的策略。

机制分析表明,在干净状态下有效的位置信息集合在实际重新计算时可能失效,因为散布的位置信息会继承周围的陈旧。编辑局部优势依赖于编辑与答案文本的相邻性;当答案所在的文本向下游移动时,这一优势几乎消失。

由于答案相关的编辑几乎必然破坏模型行为,且其失败严重程度难以预测,且修复速度比完整前填快 13‑21 倍,我们的结果支持在答案相关文本仍与编辑相邻时,采用无条件的编辑局部修复策略。

点评

原文链接: https://arxiv.org/abs/2609.17983

[h] 返回首页