NeFut Logo NeFut
EN 管理员登录

[AI学术] 何时多代理代码评审真正有依据?两种无标签测量与拒绝猜测的评审者

发布于:2026-09-28 22:00 最后更新:2026-09-30 01:41
#Codeforces #AI #Machine Learning

当一个语言模型判断另一个模型的代码是否正确时,它往往直接给出自信的结论并附上推理,却没有报告缺乏证据的情况。这样的判决与有充分依据的判决在表面上难以区分。

多代理验证的思路是把判断拆解为若干可检验的声明,并针对每个声明寻找独立的证据进行核实。该方法在证据来源为检索文档时表现良好,因为检索到的文档天然满足两个条件:① 与待评审答案独立,② 能在不同候选答案之间产生差异。

我们指出,在代码评审场景下第二个条件往往失效:检索到的代码片段或执行日志往往对所有候选解都相同,导致无法区分优劣。

为验证这一观点,我们在 MARCH 框架(保持原始实现不变)上运行了 80 组基于单元格的测量,使用两个公开的代码评审基准。结果显示,MARCH 在 78%~95% 的比较中把两种解都判为同等优秀,整体准确率仅为 4.4%,而直接让同一模型回答同一问题时的准确率为 43.7%。增加更容易的题目或使用更大的评审模型都未能改善这一现象。

我们进一步从流水线日志中提取了两项无标签度量,发现其中一项能够有效指示评审器缺乏依据。当对该度量进行阈值过滤时,系统会主动放弃无法判断的比较,准确率从 20.7% 提升至 36.9%,同时仍能对约一半的比较给出答案。

核心贡献并非提供更精准的代码评审器,而是提供一种 无标签 的方法,帮助识别评审器何时没有可靠依据,从而避免盲目给出错误结论。

点评

原文链接: https://arxiv.org/abs/2609.30328

[h] 返回首页