最近的一项研究表明,LLM 评审小组是一个标准的评估工具,但是之前的研究报告显示,小组错误率高度相关:九名评审员提供的信息大约相当于两名独立评审员的有效信息,而聚合只填补了一个小部分的差距。一个自然的解决方案——来自不同证据来源的信号,例如执行一个测试套件——在规模上没有产生可区分的变化(-0.04,95% CI [-0.10, +0.02])。聚合依赖和条件决策效用是不同的问题。基本的多数算术修复了单个选票替换的受影响集:只有决策的投票边缘为一票时才会改变。经验问题是,小组错误率是否会上升和有用的替换是否集中在这些关键查询上。结果表明,它们确实如此:整个准确率的提高集中在这些关键查询上(在三个头条配置中,准确率提高了 +10.4 到 +23.3 个百分点),而在其他地方则为零。我们在三个代码基准和四个小组规模上确认了这一模式(包括一个 9 名评审员的扩展和 56 个依赖采样检查,准确率提高了 +6.5 到 +16.1 个百分点)。在 HumanEval+/MBPP+ 上,多数替换规则提高了总体准确率从 82.44% 到 85.62%,同时在 16.2% 的查询中调用信号;仅使用信号仍然更强,达到 87.60%。因此,人口层面的依赖诊断和边缘分层效用是互补的,而受影响集的特征产生了一个调用规则,适用于任何指定的单个选票替换政策。 博主点评: 本文揭示了聚合独立度量指标可能忽略验证实际上有帮助的地方,尤其是在关键投票中。研究结果表明,准确率的提高集中在这些关键查询上,强调了在评估LLM评审小组时考虑边缘分层效用的重要性。