NeFut Logo NeFut
EN 管理员登录

[AI学术] 多模态评判模型的突破:能力导向基准与MCTS驱动的数据生成

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:18
#algorithm #AI #Machine Learning

在使用多模态大语言模型(MLLMs)作为评判者的过程中,实现精确且一致的评估已逐渐成为各个领域的新兴范式。因此,评估MLLM作为评判系统的能力和可靠性对于确保可信的评估至关重要。目前的评判基准通过任务类型对样本进行分类,但未能捕捉到可靠评估所需的基本判断能力。

为此,我们提出了M-JudgeBench,这是一种十维能力导向基准,旨在全面评估MLLM的判断能力。我们的基准将评估分解为成对的思维链(CoT)比较、避免长度偏差和过程错误检测任务,共同涵盖十个细粒度子任务。这一设计使得能够诊断模型在推理风格、响应长度和跨模型变化中的可靠性。

系统评估揭示了现有MLLM作为评判系统的系统性弱点。为了解决这个问题,我们进一步提出了Judge-MCTS,这是一个数据构建框架,生成具有不同正确性和长度的成对推理轨迹。通过Judge-MCTS,我们构建了一个增强的数据集,并训练了一系列强大的评判模型M-Judger。大量实验表明,M-Judger在现有评判基准以及M-JudgeBench上的表现优越。

总体而言,我们的工作通过M-JudgeBench和Judge-MCTS框架,为评估MLLM作为评判者建立了更为原则性的基础,为未来的评判模型评估和能力驱动的评判训练铺平了道路。

博主点评: 本文提出的M-JudgeBench和Judge-MCTS框架为多模态评判模型的评估提供了系统化的方法,尤其是在处理模型的可靠性和评估能力方面。这将为未来的研究提供重要的方向和基础。通过细化评估标准,本文有助于提升整个领域的可信度和实用性。

原文链接: https://arxiv.org/abs/2603.00546

[h] 返回首页