KV 缓存复用能够显著降低检索增强生成(RAG)和代理系统的推理成本,但当检索到的知识、工作记忆或用户状态被编辑后,缓存的上下文会变得陈旧。由于因果自注意力的特性,即使是局部编辑也会影响后续的 KV 状态。完整的重新前填(full re‑prefill)可以可靠地恢复一致性,却代价高昂;仅刷新被编辑的跨度则可能留下下游依赖的陈旧。
我们将就地修复视为预算受限的重新计算问题,并在一个包含直接编辑和派生编辑的事实 RAG 基准上比较了多种无需训练的位置信息选择策略。实验覆盖三类模型家族,所有策略都能修复直接编辑的情况,但在派生编辑上表现分化。以主要预算下的连续编辑局部窗口为例,能够恢复至少 0.94 的编辑后答案差距,显著优于基于注意力、KV 偏差和结构选择的策略。
机制分析表明,在干净状态下有效的位置信息集合在实际重新计算时可能失效,因为散布的位置信息会继承周围的陈旧。编辑局部优势依赖于编辑与答案文本的相邻性;当答案所在的文本向下游移动时,这一优势几乎消失。
由于答案相关的编辑几乎必然破坏模型行为,且其失败严重程度难以预测,且修复速度比完整前填快 13‑21 倍,我们的结果支持在答案相关文本仍与编辑相邻时,采用无条件的编辑局部修复策略。
点评