NeFut Logo NeFut
EN 管理员登录

[AI学术] ScaleCUA:提升计算机使用代理的可验证任务合成与高效在线强化学习

发布于:2026-07-15 22:00 最后更新:2026-07-17 08:46
#AI #Machine Learning #Open Source

摘要

计算机使用代理(CUAs)正在成为通过视觉感知和图形用户界面执行复杂数字工作流的强大接口。可验证奖励的在线强化学习(RLVR)成为提升其能力的关键方向。然而,这一范式受到可验证数据稀缺和在线强化学习效率低下的瓶颈。为了解决这些问题,我们提出了ScaleCUA,这是一个统一框架,通过可验证任务合成和高效训练来扩展CUAs的在线RL能力。

在数据层面,我们设计了VeriGen,这是一个通过迭代docker交互和多智能体反馈循环生成可验证RL任务的端到端框架。该管道通过共享的docker交互探头扩展到100+个并发代理工作者,生成了24K+个可验证任务和近3000个高质量RL任务。为了最大化样本效率,我们提出了Frontier Sampling,它跟踪每个任务的能力并将回滚分配到当前学习前沿。

在训练方面,我们进一步设计了视觉上下文分割,这是一个在最近视觉上下文上滑动的窗口,平衡了回滚和训练引擎的压力,使得训练速度比逐步分解快了2.83倍。结合起来,ScaleCUA在OSWorld上达到了68.7%,在ScienceBoard上达到了54.0%,在开源计算机使用代理中建立了新的最先进的性能。代码、模型和数据集可在 GitHub 获取。

博主点评:ScaleCUA为计算机使用代理的在线强化学习提供了创新的解决方案,通过可验证任务的生成和高效的训练方法,显著提升了代理的性能。这种方法在数据生成和样本效率方面的突破,预示着未来在复杂数字工作流自动化中的广泛应用潜力。

原文链接: https://arxiv.org/abs/2607.11185

[h] 返回首页