大型语言模型(LLM)驱动的代理通过编辑持久化的技能文档来自我演化。该文档记录工作流、工具使用规则以及决策逻辑。演化循环包括两步:优化器生成候选编辑,接受门决定是否采纳。过去的研究主要聚焦于优化器,而接受门仍采用最简单的规则——只要编辑提升了整体验证得分就接受。我们发现该规则存在两大缺陷:
- 永久回归:编辑可能提升平均得分,却破坏了已有的可解项目,导致技能整体退化。
- 优化器诅咒:在有限且噪声的验证集上,最高观测得分往往被高估,从而误导接受门。
为了解决上述问题,本文提出 统计接受门(SAGE)。SAGE 的核心创新有两点:
- 逐项配对比较:在相同的验证样本上同时评估原技能和编辑后技能,能够显式捕捉到隐藏在聚合得分背后的回归,并对回归进行不对称惩罚。
- 单侧配对检验:仅当编辑的胜率相对于失败的统计显著性可靠时才提交编辑,否则保持原状。该检验在边界设置下恰好恢复标准门的行为,因而是一种保守的改进。
实验在五个基准任务和四种主流 LLM(在等预算协议下)上进行。SAGE 在 20 组实验中有 19 组显著降低了回归率,剩余 1 组与基线持平。例如在 LiveMath 上回归率从 36.5% 降至 0%,在 OfficeQA(DeepSeek‑V4)上从 42.8% 降至 0%。同时,SAGE 在所有 20 组实验中取得最高的最终得分,LiveMath 的分数从 34.15 提升至 48.78。
点评:SAGE 通过统计配对检验有效抑制了盲目接受编辑的风险,兼顾了性能提升与安全性,是自演化代理系统中值得推广的门控机制。