在大型语言模型(LLM)代理的实际使用中,常通过 harness evolution 来改进提示、工具和工作流,但优化器本身的诊断、编辑和测试手段往往保持不变。我们探讨了让优化器也能够自我进化——即改进自身的失败分析、编辑生成和效果验证——是否能更有效地提升被优化的代理。
两条实验观察指引了设计思路:
- 在受控实验中,若缺乏基于执行的验证,自我进化的优化器几乎无法提升性能;一旦加入验证机制,性能提升显著,甚至超过所有对照组。
- 在跨五种执行器的实验中,自我进化的优化器会自行构建用于失败分析、验证、训练审计以及工作流控制的工具集合。
基于上述发现,我们提出 VERSE(Verified Self‑Evolving optimizer for agent harnesses)。VERSE 的核心流程包括:
- 对草稿编辑进行 测试,在提交前 回放 失败案例并 扰动 可疑步骤;
- 在每轮迭代中记录修复与回归;
- 利用这些反馈同时更新执行器的 harness、优化器的提示、技能、工具、钩子和注释;
- 关键是模型权重保持不变,仅通过元层面的改进提升整体表现。
在共享协议下,训练、验证和测试任务相互独立。VERSE 在四个已评估的 harness 优化器上均取得提升,在 SWE‑rebench 的持出任务和五种语言的分布外任务上表现尤佳。最佳的验证选取的 harness 在验证集和测试集上的准确率分别达到 42.3% 与 37.7%,而最强基线仅为 39.2% 与 29.3%。
代码已开源:https://github.com/wzekai/VERSE
点评