NeFut Logo NeFut
EN 管理员登录

[AI学术] 环境进化用于终端代理

发布于:2026-09-04 22:00 最后更新:2026-09-05 12:23
#AI #Machine Learning #LLM

交互式、可验证的环境规模化是训练终端代理的关键。随着前沿模型能力提升,完全从零合成的环境难度下降,学习信号有限。已有的共进化方法通过在策略回合中发现模型弱点,迭代生成接近学习前沿的环境,但其依赖于 on‑policy 回合,导致模型强化后难以继续提供有效信号。\ \ 本文提出 环境进化(environment evolution),在 off‑policy 条件下逐步提升环境难度,并在训练过程中按代(generation)调度进化环境,以实现持续的学习信号。我们从多回合学习目标出发,推导出影响环境难度的三条进化方向,并通过循环设计的多代理框架(loop‑engineered multi‑agent harness)在这三条方向上实现进化。\ \ 在 Hy4 preview、Claude Opus 5 和 GPT‑5.6 Sol 上的量化回合实验表明,环境进化能够系统地产生更具挑战性的环境。进一步在 Qwen3.6‑27B 与 Qwen3.6‑35B‑A3B 上进行长时程强化学习训练,分别在 Terminal‑Bench 2.1 上提升了 14.4% 与 18.0% 的性能。\ \ 点评

原文链接: https://arxiv.org/abs/2609.04128

[h] 返回首页