自动化 Harness 优化通过迭代更新提示、工具接口和控制逻辑,能够显著提升 LLM 代理的表现。现有方法大多只关注 Harness 本身的更新,而训练场景(即反馈来源)基本保持不变。随着 Harness 的演进,最有价值的场景也会变化,这表明训练课程需要与 Harness 同步演化。我们将这一缺失维度定义为自动化课程学习问题,并提出 ActiveSaddler。ActiveSaddler 将不断变化的课程建模为非平稳多臂赌博机,其中每个臂对应一个可动态实例化的优化目标。它把重复出现的失败抽象为可复用的失败模式臂,估计针对每种模式进一步学习的潜在进步,并在复访已知弱点和探索新场景之间自适应平衡。优化结果会持续更新已发现的失败模式集合及其优先级,使课程能够与 Harness 共进化。实验在 GAIA2 和 Terminal‑Bench 2.0 上表明,ActiveSaddler 能持续发现更强的 Harness,分别将测试 Pass@1 提升 4.4% 和 7.5%,相较于使用固定场景顺序的同类优化器。消融实验进一步证明,收益来源于动态构建优化目标、估计其演化效用以及在持续优化与新失败发现之间的平衡。综上,自动化课程学习成为 Harness 优化的关键新维度。
点评