使用 Claude Opus 等前沿模型作为元代理生成终端任务和验证器已成趋势,但可运行的 Docker 镜像和测试套件并不等同于端到端的训练可靠性。我们构建了一个元代理流水线,聚焦三类失效:基准无效、执行框架脆弱以及奖励错位。通过重新设计提示并扩展上下文,基线可解性提升 5.6 倍;然而在 Claude Opus 生成的任务上,9B 模型的平均 pass@2 在 20 步内最高只能达到 81.3%。在不改动训练配置的前提下加入硬任务后,平均 pass@2 降至 20.6%,强烈表明可解性区间随模型而异。研究表明,元代理的可靠性必须把可解性区间校准、验证器审计以及基础设施错误计入首要评估,而非事后诊断。
点评