NeFut Logo NeFut
EN 管理员登录

[AI学术] 推理评审团:多模型共识用于评估推理轨迹

发布于:2026-08-14 22:00 最后更新:2026-08-16 07:03
#LLM #Artificial Intelligence #Reasoning

提高推理LLM的能力需要能够评估长推理轨迹的质量,以实现有效的推理数据策划、在强化学习期间提供强大的训练信号以及在模型性能评估期间深入了解推理行为。另外,揭示模型在推理中的错误将能够通过提供反馈来提高模型在运行时的性能。由于这个复杂任务的难度,单模型评判(甚至是最先进的模型)在识别推理缺陷方面并不出色。此外,在推理LLM的在线训练期间,通常禁止使用最先进的模型,因为它们有使用限制。在这项工作中,我们提出推理评审团,这是一个用来取代单一评判的系统,通过多个LLM和一个调解共识机制来提高识别推理缺陷的判断的准确性。在推理评审团中,推理轨迹的缺陷及其严重程度通过一个调解过程来确定,其中调解员在评审团中进行讨论,评审员相互批评对方的判断,并可以修改他们的初步投票。调解员通过评审团的讨论或判断的整合来得出共识。我们展示了推理评审团在识别推理缺陷方面的准确性优于最先进的模型(opus-4.6、sonnet-4.6和gemini-3.1-pro)。此外,评审团的总成本(初步判决、讨论、整合等)仅为在LLM-as-a-judge设置中运行最先进模型的成本的8%至15%。我们还展示了如何利用这些判断来了解推理LLM在基准测试中的故障模式,这使得对模型性能有更深入的理解。 博主点评: 本文提出了一种多模型共识的方法来评估推理轨迹,这是一种创新的解决方案,可以提高识别推理缺陷的准确性,并减少计算成本,这对于提高LLM的性能有着重要的意义。

原文链接: https://arxiv.org/abs/2608.12585

[h] 返回首页