近年来,记忆已成为长时程AI代理的核心组成部分,使得代理在操作网页浏览器、软件工具及其他交互式环境时可以重用过去的经验。然而,现有研究大多将记忆视为一种供给问题,关注于写入什么经验、如何存储及下一任务检索哪个条目。我们却缺乏对模型如何在多步骤行动轨迹中消费检索记忆的清晰描述。这个消费过程至关重要,因为它不仅决定了应检索哪些记忆,还决定了需要哪些模型和控制策略以安全使用这些记忆。
为了诊断这个过程,我们提出了条目-传播-恢复(E-P-R)框架,关注记忆如何在行动中首次改变,变化是否会持续,以及代理在偏离正确路径后是否能够恢复。我们在WebArena和我们构建的控制基准MemTrapBench上实例化了E-P-R,以隔离这些阶段。研究发现,主要的失败通常始于条目:代理在第一个暴露的决策点上即采用了冲突记忆,即使该记忆在任务中是错误的。重复暴露会放大这一早期错误,而在偏离后恢复能力较弱。这些效应共同形成了合规陷阱:在不同模型中,冲突记忆诱导了相似的合规率,但一旦代理遵守,它们的成功率便急剧下降到低水平。因此,强大的代理遭受的绝对损害更大,因为每次合规事件都会抹去更多的基础能力。这些结果表明,增强记忆的代理评估不仅应关注检索质量或最终成功率,还应关注它们在整个轨迹中如何消费记忆。
博主点评: 本文深入探讨了AI代理在处理记忆时的复杂性,尤其是在面对冲突信息时的决策过程。E-P-R框架提供了一个有力的工具来分析这一现象,强调了记忆管理在复杂任务执行中的重要性。未来的研究应进一步探索如何优化记忆消费过程,以提升AI系统的整体性能。