NeFut Logo NeFut
EN 管理员登录

[AI学术] 无奖励自我进化代理:基于成对验证者的创新方法

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:18
#algorithm #AI #Machine Learning

在自我进化的代理循环中,代理会反复提出其模板或程序的修改版本,并根据每次迭代的质量信号接受或拒绝该修改。设计这个信号通常是项目中最昂贵的部分:一个可靠的标量奖励需要领域专业知识和标注示例,而这些示例的收集成本与代理的基础任务同样高昂。

我们提出用成对验证者替代接受/拒绝环节中的标量验证者:一个冻结的 LLM(大语言模型),它在给定父代理和子候选的情况下返回哪个更好的二元判决。成对判断通常比绝对评分更容易且更稳定,因为其对比性质减少了对严格尺度校准的需求。该验证者也不需要自身的训练。

我们将验证者集成到三个已发表的自我进化引擎(GEPA、ADRS、ShinkaEvolve)中,并报告了两种变体:自适应聚焦,保留引擎现有的验证集父选择;软 Elo,让验证者的判决驱动父选择,从而验证集奖励也随之下降。

在多个代理和两种工件基础(提示和代码)上,我们的方法在我们评估的大多数设置中与全奖励基线相匹配或超越,并且该模式在跨家族验证者交换中依然有效。因此,成对验证者可以无缝替代逐步奖励设计,保持竞争性的任务准确性而无需标注成本。

博主点评: 该研究通过引入成对验证者,成功地降低了自我进化代理在奖励设计中的标注成本,同时保持了性能。这种方法的创新性在于它利用了对比判断的优势,减少了对严格标度的依赖,值得在更广泛的领域中进一步探索。其在实际应用中的潜力也不容忽视。

原文链接: https://arxiv.org/abs/2607.14408

[h] 返回首页