NeFut Logo NeFut
EN 管理员登录

[AI学术] OpenForgeRL:在任意环境中训练基于Harness的智能体

发布于:2026-07-25 22:00 最后更新:2026-07-26 07:44
#AI #Open Source #Reinforcement Learning

现代AI代理依赖于复杂的推理框架,如Claude Code、Codex和OpenClaw,以进行多轮推理、工具使用和访问外部系统。尽管这些框架功能强大,但也使得在开放基础设施中进行端到端训练变得困难,因为其SFT/RL框架无法原生表达有状态的多进程推理。为此,我们提出了OpenForgeRL,这是一个开源框架,用于在多样化环境中端到端训练基于Harness的智能体。

OpenForgeRL通过一个轻量级代理来实现这一目标,该代理服务于Harness的模型调用,同时将其记录为标准RL代码库(例如veRL)的训练数据,并且使用Kubernetes调度器在各自的远程容器中运行每次回合,从而支持在任何环境中对任何Harness进行大规模训练。通过解耦训练与推理,OpenForgeRL使研究人员能够轻松地在实际的Harness和环境中直接训练、研究和改进智能体。

我们在多种复杂的Harness和环境中验证了我们的框架,包括基于工具/爪的智能体和多模态GUI浏览器及计算机使用智能体。使用仅数百到几千个任务,OpenForgeClaw在ClawEval上达到了31.7 pass@3和55.9 pass@3,在QwenClawBench上达到了33.7。OpenForgeGUI在OSWorld-Verified上达到了37.7,在Online-Mind2Web上达到了63.0,在WebVoyager上达到了72.3。两者在几乎所有基准测试中都超越了相似规模的开放基线,并且在GUI设置中与几倍更大的模型相匹配或超越。

除了基准,我们还分析了Harness选择(例如ZeroClaw、OpenClaw、Codex)和强化学习如何影响智能体行为。我们发现某些Harness的学习难度显著高于其他Harness,强化学习提高了智能体的可靠性,例如自我验证、工具覆盖和完成多步骤计划,尽管诸如错误恢复等关键能力仍然较弱。

博主点评: OpenForgeRL的提出极大地推动了基于Harness智能体的训练效率,尤其是在多种复杂环境下的应用。其通过Kubernetes的容器化管理,使得训练过程更加灵活和高效,展示了开源框架在现代AI开发中的重要性。

原文链接: https://arxiv.org/abs/2607.21557

[h] 返回首页