摘要
大多数代理优化方法报告的收益是一次性的:优化代理针对固定基准后,结果改善被视为该方法的稳定特性。这并未测试对已部署代理重要的情境,即随着时间推移,新的失败和任务出现时,优化是递归应用的。由此引发的核心问题是,优化器驱动的收益是否会复合:在代理优化一次后,能否在新任务上再次优化而不损害第一次产生的收益?
我们通过在 Terminal-Bench 2.0 中构建的两阶段持续学习评估来研究这个问题,比较三种代理优化方法(GEPA、Meta Harness 和 RELAI 的可验证持续学习 RELAI-VCL),在相同的优化预算下进行评估。所有三种方法在传统的静态单阶段设置中均优于基线代理。然而,一旦引入新任务,这些方法的表现截然不同:GEPA 优化后的代理传输性能低于未优化的基线,Meta Harness 在获得第二次优化预算时表现良好但未能进一步改善,而 RELAI-VCL 是唯一一种在未见任务上正向传输并在将这些任务纳入优化目标后继续改善的方法,在每个评估阶段都达到最高的通过率,并且整体上实现了最高的终身平均通过率(76.4% 对比 GEPA 的 66.0%、Meta Harness 的 64.6% 和基线的 58.7%)。
我们的关键观察是,优化收益只有在优化循环中内置回归控制时才会复合,这为抗捷径解决方案提供了归纳偏置,而这些解决方案往往无法泛化。
博主点评: 文章深入探讨了在持续学习环境中,代理优化器的复合效应,揭示了传统优化方法在动态任务环境下的局限性。RELAI-VCL 的成功表明,设计具有回归控制的优化流程,可以有效提升代理在新任务上的适应能力和长期表现。