NeFut Logo NeFut
EN 管理员登录

[AI学术] SETA:为终端智能体扩展环境的新突破

发布于:2026-07-15 22:00 最后更新:2026-07-17 08:47
#Open Source #Reinforcement Learning #Terminal

摘要

大型语言模型(LLMs)正在快速转向通过多种接口解决任务的智能体,包括网络和图形用户界面(GUIs)。其中,终端命令行提供了一种基于文本的通用接口,涵盖从系统操作到数据科学和机器学习的任务。然而,扩展终端智能体的训练仍然具有挑战性,因为这需要多样化且连贯的任务指令、可执行环境和可靠的验证,同时缺乏自然基础的监督数据。

在本研究中,我们提出了SETA,这是一个用于生成可验证终端环境的可扩展框架,旨在强化学习(RL)中使用。该框架由两个共享统一验证机制的管道组成:SETA-Synth将多样化来源转换为标准化的RL环境,而SETA-Evol则在现有环境的基础上,通过自适应控制难度和多样性进一步扩展。

通过这两个管道,我们构建并发布了SETA-Env,这是迄今为止最大的开源可验证终端RL数据集,包含超过4500个环境。我们通过在SETA-Env上训练Qwen3-8B与GRPO进行评估,达到了12%的通过率,这是在8B规模下RL训练模型的最佳报告结果。此外,我们还观察到在相同的终端智能体环境下,DeepSeek-V4-Flash的表现有所提升,Terminal-Bench 2.0的pass@1从40%提高到43%,pass@5从54%提高到58%。这些结果表明,SETA-Env为终端智能体提供了高质量的训练环境,并作为推动终端基础智能体学习研究的宝贵资源。

博主点评:SET的提出为终端智能体训练提供了新的可能性,不仅丰富了可用的环境,还通过验证机制确保了训练的可靠性。SETA-Env的规模和质量将极大推动相关领域的研究进展,值得关注!

原文链接: https://arxiv.org/abs/2607.10891

[h] 返回首页