我们提出了 AREX-2,旨在提升大语言模型(LLM)代理的自我改进能力,即在测试阶段能够迭代优化解答。该能力依赖两项互补技术:反思(生成优于当前解的方案)和长时程执行(保证多轮迭代仍保持有效)。我们假设这两项技术与具体领域无关,因而可以在易于监督的场景中学习。为此,我们从机器学习和算法编程任务中合成了长时程改进轨迹,这些任务提供可验证的反馈并奖励持续迭代。基于这些数据,使用 Qwen3.8-27B 构建的代理在 MLE‑bench Lite 上取得 81.8 分、Frontier‑CS 上 70.7 分,并在更具挑战性的研究任务中实现了 BrowseComp 84.0、HLE 52.6、GAIA 92.2、DeepSearchQA 93.8 的成绩,且随着迭代轮数的增加仍能继续提升。这表明长时程反思数据是实现自我改进代理的有效路径。
点评