NeFut Logo NeFut
EN 管理员登录

[AI学术] AutoGym:蓝图优先的可验证智能体训练平台

发布于:2026-09-23 22:00 最后更新:2026-09-24 00:40
#AI #Machine Learning #Reinforcement Learning

强化学习训练智能体需要一个 gym,包含任务、可执行环境以及能够可靠判别成功与否的验证器。传统构建方式人工成本高、静态且难以扩展,随着模型能力提升,任务集合容易饱和并受到污染。合成方法虽能提供规模,但一次性生成的任务难度往往表面化,模型即使能力相当也能凭借语言技巧完成,且正确性只能事后依赖不可靠的 LLM 判官。\ \ AutoGym 提出从最小的领域种子或已有轨迹出发,自动生成完整的 gym(任务、环境、验证器)。其核心机制包括:\

  1. 蓝图优先生成:在实际环境实现前先定义可行解空间、环境需求和验证标准,使可解性成为构造前提,而非事后检验。\
  2. 显式生成参数:通过控制任务拓扑、交互深度、能力维度、问题混淆和干扰项组合,实现对难度的细粒度调节。\
  3. 主动课程合成:依据模型表现实时校准参数分布,随能力提升动态调整任务难度。\ \ 在生产力和时间推理两大场景实验中,AutoGym 能生成覆盖全能力谱的 gym,甚至出现能够挑战前沿模型的实例。\ \ 点评
原文链接: https://arxiv.org/abs/2609.22592

[h] 返回首页