递归合成(Recursive Synthetic Terminal Tasks,RST)是一种用于构建长时间范围终端代理任务的递归验证合成框架。从经过验证的种子任务开始,RST 扩展参考解决方案,重新对齐验证器和指令,以适应新的工作流程,在一个新的沙盒中验证结果,并将接受的任务作为后续轮次的种子。 在十五轮递归中,RST 生成了 37,484 个合成的终端代理任务,每个任务的成本约为 0.05 美元。任务的难度在轮次中显著增加:中位数参考解决方案从 67 行增加到 374 行,中位数执行的命令数量从 40 增加到 244,DeepSeek-V4-Pro 通过率从 $R_1$ 的 90% 下降到 $R_{15}$ 的 2.5%。 为了展示训练的实用性,我们收集了在合成任务上拒绝采样的 Qwen3.5 轨迹,并将其用于监督微调。使用这些轨迹进行微调可以将 Qwen3.5-27B 和 Qwen3.5-122B-A10B 的性能提高多达 10 分,在 Terminal-Bench~2、Terminal-Bench Hard 和 Long-Horizon Terminal Bench 上,代理 PPO 将 Qwen3.5-27B 提升到 49.44%、32.00% 和 22.07%,相对于基线模型的相对增益分别为 20.0%、41.2% 和 21.9%。 此外,在 15 轮之后,递归没有显示出上限:合成产量和验证率保持稳定,难度不断增加,表明该过程可以继续进行,远远超过这里报告的规模。 博主点评: 递归合成为长时间范围终端任务的构建提供了一个高效且可扩展的解决方案,其在提高任务难度和模型性能方面的潜力非常巨大,值得进一步探索和应用。