NeFut Logo NeFut
EN 管理员登录

[AI学术] AREX:迈向递归自我提升的深度研究代理

发布于:2026-07-25 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #optimization

在深度研究中,代理需要找到满足多个约束的答案。这种发现过程成本高昂,而验证候选答案通常可以分解为可处理的约束检查。这种发现-验证不对称性表明,研究代理不仅需要延长搜索时间,还应通过验证中间结果来递归提升当前答案,并利用部分验证的状态指导后续的改进。

我们介绍了AREX,一种递归自我提升(RSI)深度研究代理的系列模型。AREX在内层研究循环中收集证据并构建临时答案,然后在外层自我提升循环中逐项审核答案,识别未解决的声明并启动针对性的后续研究。

为了在长时间范围内保持RSI,AREX学习了一种自主的上下文更新工具,该工具将不断增长的交互历史压缩为紧凑的改进状态,保留已验证的证据和未解决的约束,而无需依赖外部模型。

我们在经过验证的合成任务和高质量轨迹上训练AREX,通过代理中期训练和长时间范围强化学习来实现。为了缓解长时间学习中的稀疏最终奖励,我们强调关键步骤,在这些步骤中获取决定性证据或纠正错误的研究方向。

我们实例化了一个密集的4B模型和一个122B-A10B混合专家模型。在BrowseComp、WideSearch、DeepSearchQA、Humanity's Last Exam (HLE)及其他推理和工具使用基准上,AREX显著超越了可比规模的基线,并在激活参数数量大幅增加的模型中保持竞争力。

博主点评: AREX通过递归自我提升机制显著提高了深度研究的效率,尤其是在应对复杂约束时的表现尤为突出。其创新的上下文更新工具为长时间范围的学习提供了有效支持,展示了未来研究代理的发展方向。该模型在多项基准测试中表现优异,预示着在深度学习领域的广泛应用潜力。

原文链接: https://arxiv.org/abs/2607.21461

[h] 返回首页