NeFut Logo NeFut
EN 管理员登录

[AI学术] 上下文变化时:理解大语言模型的更新失效

发布于:2026-10-01 22:00 最后更新:2026-10-06 12:11
#algorithm #LLM #Artificial Intelligence

在实际使用中,LLM 代理会遇到偏好、目标和事实随时间变化的情况。模型需要在对话或日志中同时保留旧的上下文,但仍必须使用最新的状态。若模型仍然返回同一变量的旧值,我们称之为陈旧绑定(stale binding)。

为量化何时以及为何出现陈旧绑定,作者提出了 受控上下文记忆基准(Controlled In-Context Memory,CICM),该基准通过对话和代理日志追踪信息的更新并检测模型是否正确使用最新值。实验显示,即使是最前沿的推理模型也常常无法恢复当前状态。

在开源模型中,使用探针仍能检索到更新后的值,这表明模型内部仍保留了最新信息,只是未能在生成答案时选取。进一步在 Qwen 与 Pythia 系列模型上进行组件测试,发现一种 注意力漂移(attention drift)机制:在生成答案时,注意力倾向于旧值而非当前值。

为解释该现象,作者分析了单层 Transformer 的数学形式。当注意力分数相近时,多个旧值的注意力加权和可能超过当前值,从而导致模型输出陈旧信息。基于此洞见,作者设计了一种无需额外训练的干预:在推理阶段显式将注意力重新分配到当前值上。

实验表明,在直接请求当前值的情形下,对每个输入进行该干预能够纠正大多数旧值错误,同时几乎不影响原本正确的答案。由此可见,可靠的上下文管理不仅需要记住更新信息,还必须在推理时正确利用这些信息。

点评

原文链接: https://arxiv.org/abs/2609.38866

[h] 返回首页