NeFut Logo NeFut
EN 管理员登录

[AI学术] AMBER:通过追加式记忆训练长时程网页代理

发布于:2026-10-07 22:00 最后更新:2026-10-08 01:25
#AI #Machine Learning #LLM

现代语言模型代理在网页等外部环境中执行长时程、多步交互时,交互历史很快超出上下文容量。为保证可靠性,代理需要在长序列中保持事实信息、记住执行错误及纠正反馈、跟踪动作进度。已有方法包括仅使用推理与动作历史、通过覆盖机制学习固定大小记忆、以及周期性摘要。覆盖记忆理论上可以保存追加式记忆的所有信息,但必须在每次重写时携带每条事实,稀疏的结果奖励使得学习困难;在网页代理实验中,训练得到的覆盖记忆会删除关键信息和环境反馈。

AMBER(Append‑only Memory Bank for Evidence Retention)提出一个简单可扩展的框架:代理在推理、行动的同时自由写入追加式记忆,追加规则保证信息永不被覆盖。该设计使得可以仅凭结果奖励进行端到端强化学习,无需大量人工标注的指令微调数据。实验在 WebArena Lite 上显示,AMBER 相比覆盖记忆提升平均成功率 4.09%,在五次重复运行中任务完成率提升 4.8%,且性能可匹配使用更昂贵监督的覆盖基线。与此同时,AMBER 仍保持实用的 token 预算,在上下文效率、任务表现和长时程可靠性之间取得良好平衡。

点评

原文链接: https://arxiv.org/abs/2610.07118

[h] 返回首页