NeFut Logo NeFut
EN 管理员登录

[AI学术] AREX-2:通过长时程反思任务推进自我改进代理

发布于:2026-10-01 22:00 最后更新:2026-10-06 12:11
#algorithm #Machine Learning #LLM

我们提出了 AREX-2,旨在提升大语言模型(LLM)代理的自我改进能力,即在测试阶段能够迭代优化解答。该能力依赖两项互补技术:反思(生成优于当前解的方案)和长时程执行(保证多轮迭代仍保持有效)。我们假设这两项技术与具体领域无关,因而可以在易于监督的场景中学习。为此,我们从机器学习和算法编程任务中合成了长时程改进轨迹,这些任务提供可验证的反馈并奖励持续迭代。基于这些数据,使用 Qwen3.8-27B 构建的代理在 MLE‑bench Lite 上取得 81.8 分、Frontier‑CS 上 70.7 分,并在更具挑战性的研究任务中实现了 BrowseComp 84.0、HLE 52.6、GAIA 92.2、DeepSearchQA 93.8 的成绩,且随着迭代轮数的增加仍能继续提升。这表明长时程反思数据是实现自我改进代理的有效路径。

点评

原文链接: https://arxiv.org/abs/2609.38288

[h] 返回首页