NeFut Logo NeFut
EN 管理员登录

[AI学术] 何时可以忘记推理?长时程智能体上下文压缩的 ICLR 方法

发布于:2026-09-26 22:00 最后更新:2026-09-28 00:49
#algorithm #AI #LLM

长时程语言模型智能体在交互过程中会不断累积推理历史,导致上下文长度持续增长,即使早期的决策已经执行并观察到结果,仍会增加推理成本。与静态的思路链压缩不同,删除历史推理可能会改变后续行为及交互轨迹。我们研究了何时可以安全地忘记这些推理。

我们提出 交互感知压缩(ICLR),这是一种无需额外训练的在线方法。ICLR 使用冻结的代理熵对推理块进行排序,同时保留动作、工具调用和观察结果。

在 260 项 WorkBuddyBench 任务上,ICLR 将平均奖励从 0.699 提升至 0.718,输入 token 减少 25.5%,输出 token 减少 14.4%,缓存读取 token 减少 33.3%。

消融实验揭示了 轨迹放大 现象:局部删除推理会通过改变后续交互产生非线性计算变化。进一步的表示探测、激活修补以及受控轨迹分析表明,一旦任务相关的派生状态被可靠地外部化为代码、文件、工具输出或环境反馈,历史推理就变得更易替代。

这些发现将智能体的推理描述为一种动态工作状态,而非永久的交互历史。

点评

原文链接: https://arxiv.org/abs/2609.29875

[h] 返回首页