NeFut Logo NeFut
EN 管理员登录

[AI学术] 精准却分离:评审精度并不保证多智能体数学推理中的批评采纳

发布于:2026-07-20 22:00 最后更新:2026-07-22 01:02
#algorithm #AI #Machine Learning

摘要

许多数学和科学导向的智能体系统采用层次化设计,设定专门的评审角色,假设专门的评审阶段能够将错误的候选者转变为正确的。我们在 4,181 个验证者基础的 Omni-MATH 问题上测试了这一假设,使用匹配的 gpt-oss-120b 角色。合作在最简单的层次上几乎没有增加,但从第 4 层开始,收益显著增加;在这个更困难的领域,广播式的同行讨论达到了比计划-执行-评审(PER)管道更高的最终准确性。我们探讨这种差距是否由评审质量或批评是否改变下一个答案的协议推动所解释。仅仅通过评审者的精度无法解释这一点:PER 的评审者精度较高(0.861 对 0.644),然而评估者验证的有用批评却更少可能改变下一个候选者,并且产生较低的评审者指导修复。这些结果表明,评审者检测质量和批评采纳在实证上是可分开的。在匹配的 PER 干预中,强制显式承认会降低最终准确性,而将评审者指导直接嵌入解算器的工作上下文中则部分改善了后续执行,但并未弥补差距。总体而言,基于评审者的评估可能会夸大系统质量:一种协议可能能够很好地发现错误,但如果不对这些批评采取行动,仍然无法解决更多问题。

博主点评: 本文揭示了评审过程中的潜在缺陷,尤其是强调了批评的采纳与评审质量之间的区别。尽管高精度评审者能够识别错误,但若未能有效应用批评,系统性能依然受限。这为未来的智能体设计提供了重要的启示,需关注如何提高批评的实际应用效果。

原文链接: https://arxiv.org/abs/2607.15388

[h] 返回首页