NeFut Logo NeFut
EN 管理员登录

[AI学术] 终端代理训练停滞:数据生成与验证挑战解析

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

使用 Claude Opus 等前沿模型作为元代理生成终端任务和验证器已成趋势,但可运行的 Docker 镜像和测试套件并不等同于端到端的训练可靠性。我们构建了一个元代理流水线,聚焦三类失效:基准无效、执行框架脆弱以及奖励错位。通过重新设计提示并扩展上下文,基线可解性提升 5.6 倍;然而在 Claude Opus 生成的任务上,9B 模型的平均 pass@2 在 20 步内最高只能达到 81.3%。在不改动训练配置的前提下加入硬任务后,平均 pass@2 降至 20.6%,强烈表明可解性区间随模型而异。研究表明,元代理的可靠性必须把可解性区间校准、验证器审计以及基础设施错误计入首要评估,而非事后诊断。

点评

原文链接: https://arxiv.org/abs/2610.02405

[h] 返回首页