摘要
长时程任务需要持续的感知、推理和探索,这对大型语言模型(LLM)代理来说始终是一项挑战。这一差距在持续学习基准(如 ARC-AGI-3)上的有限表现中得以体现,尤其是在模型按原样评估时。为缩小这一差距,提出了多种代理框架,每种框架都承诺采用一种处理长序列观察的方法,即如何从环境中保存信息以及如何将其加载到模型上下文中,我们认为这一选择尤其重要。
现有的上下文管理方法面临显著的权衡,因为保留更多信息使得检索相关细节变得不那么可行。为此,我们提出了 PRO-LONG,这是一种围绕程序化记忆构建的最小上下文管理框架,适用于长时程探索性环境中的 LLM 代理。PRO-LONG 通过保持完整的结构化交互日志来解决这一权衡,并利用最近在编码代理方面的进展高效搜索这一历史记录。
在完整的 ARC-AGI-3 公共游戏集上,PRO-LONG 相较于基础编码代理平均提高了 18.0 个百分点,并在使用 4.2-5.8 倍更少的 tokens 的情况下,匹配或超越了最先进的专用框架(最高达到 76.1% pass@1)。使用 Fable 5 时,PRO-LONG 在总成本为 1750 美元的情况下达到了 97.4% best@2。相关代码和日志可在 GitHub 上获取。
博主点评: PRO-LONG 的提出为 LLM 代理在处理长时程任务时提供了新的思路,尤其是在信息管理与检索效率之间的权衡上。利用程序化记忆框架,有效提升了模型的表现,值得在实际应用中进一步探索和验证。