LLM 的应用正从被动的语言接口快速转向能够在有状态工作空间中执行长时序任务的爪状(Claw‑like)自主代理。Agentic Reinforcement Learning 为这些代理的优化提供了可行路径,但其规模受限于交互式训练环境的极度稀缺。现有的合成环境仅支持工具调用接口,无法满足爪状代理对端到端真实工作流的需求。\ \ 为了解决这一瓶颈,本文提出 EnvCraft——一个自动化框架,用于合成可直接执行的环境并生成大规模训练数据。EnvCraft 包含两大核心引擎:\
- 环境合成引擎:在沙盒中构建相互隔离的工作空间,确保安全且可重复的交互;\
- 拓扑感知数据生成引擎:依据环境的结构拓扑生成连贯的任务轨迹,保证任务之间的逻辑一致性。\ \ 通过该框架,我们合成了 139 个交互式环境,累计约 20 000 条复杂任务,用于 Agentic RL 的训练。实验在 Qwen3/3.5 系列模型(8B‑32B)上进行,结果显示在爪状基准上提升最高 +11.9%,在通用工具使用基准上提升 +8.0%,同时显著降低推理时的 token 消耗。\ \ 这些结果验证了可执行合成环境能够提供稳健且具通用性的学习信号,为大规模 Agentic RL 训练奠定了基础。\ \ 点评