强化学习训练智能体需要一个 gym,包含任务、可执行环境以及能够可靠判别成功与否的验证器。传统构建方式人工成本高、静态且难以扩展,随着模型能力提升,任务集合容易饱和并受到污染。合成方法虽能提供规模,但一次性生成的任务难度往往表面化,模型即使能力相当也能凭借语言技巧完成,且正确性只能事后依赖不可靠的 LLM 判官。\ \ AutoGym 提出从最小的领域种子或已有轨迹出发,自动生成完整的 gym(任务、环境、验证器)。其核心机制包括:\
- 蓝图优先生成:在实际环境实现前先定义可行解空间、环境需求和验证标准,使可解性成为构造前提,而非事后检验。\
- 显式生成参数:通过控制任务拓扑、交互深度、能力维度、问题混淆和干扰项组合,实现对难度的细粒度调节。\
- 主动课程合成:依据模型表现实时校准参数分布,随能力提升动态调整任务难度。\ \ 在生产力和时间推理两大场景实验中,AutoGym 能生成覆盖全能力谱的 gym,甚至出现能够挑战前沿模型的实例。\ \ 点评