NeFut Logo NeFut
EN 管理员登录

[AI学术] 自我进化的评估体系:用于自我提升 LLM 代理的共生评估指标与技能

发布于:2026-07-15 22:00 最后更新:2026-07-17 08:46
#optimization #LLM #Artificial Intelligence

在自我进化的代理系统中,技能的创造、修订和淘汰依赖于一个隐藏的假设:可靠的评估指标已经存在。然而,在许多实际应用中,这种指标并不存在。我们提出三项主张。

首先,评估指标可以被 \textbf{进化}:我们的指标循环在完整的进化生命周期中搜索小型缺陷检测器的组合,训练以与十项锚定参考集一致,并通过对未标记输出的共识进行正则化,最终审计对一个未曾阅读的保留锚点,产生透明且可检查的评估指标,而非模糊的评判者。

其次,由于不存在可以超越的评估指标,我们的 \textbf{双重棘轮}(Double Ratchet)机制通过与生命周期管理的技能循环共同进化,恢复了准确的评估指标所能实现的效果:在代码生成(MBPP+)、企业文本转 SQL(Spider~2.0-Snow)和无参考报告生成中,保持了88%至110%来自于同一技能循环所驱动的真实基准或最佳可用标准的提升。

第三,安全性来自于锚定纪律和外部审计:去除锚定保护会使指标崩溃为一个空洞的检测器,而去除生命周期则不会;当进化的技能试图操控报告标准时,一个独立的评审者识别了这一点,一个检测器进行了修复,而一个任务感知的评审者随后在77%的决定对中偏好进化后的输出而非进化前的基线。

我们认为,这种预期失败的架构在没有可靠的自动验证器存在时是合适的默认选择。

博主点评: 本文提出了一个创新的自我进化评估体系,通过双重棘轮机制有效提升了 LLM 代理的性能,展现了在缺乏可靠评估指标时的解决思路,具有很高的实用价值和理论意义。其透明的评估过程和严格的审计机制为未来的智能系统设计提供了重要的参考。

原文链接: https://arxiv.org/abs/2607.12790

[h] 返回首页