长时程语言模型智能体在交互过程中会不断累积推理历史,导致上下文长度持续增长,即使早期的决策已经执行并观察到结果,仍会增加推理成本。与静态的思路链压缩不同,删除历史推理可能会改变后续行为及交互轨迹。我们研究了何时可以安全地忘记这些推理。
我们提出 交互感知压缩(ICLR),这是一种无需额外训练的在线方法。ICLR 使用冻结的代理熵对推理块进行排序,同时保留动作、工具调用和观察结果。
在 260 项 WorkBuddyBench 任务上,ICLR 将平均奖励从 0.699 提升至 0.718,输入 token 减少 25.5%,输出 token 减少 14.4%,缓存读取 token 减少 33.3%。
消融实验揭示了 轨迹放大 现象:局部删除推理会通过改变后续交互产生非线性计算变化。进一步的表示探测、激活修补以及受控轨迹分析表明,一旦任务相关的派生状态被可靠地外部化为代码、文件、工具输出或环境反馈,历史推理就变得更易替代。
这些发现将智能体的推理描述为一种动态工作状态,而非永久的交互历史。
点评