在使用多模态大语言模型(MLLMs)作为评判者的过程中,实现精确且一致的评估已逐渐成为各个领域的新兴范式。因此,评估MLLM作为评判系统的能力和可靠性对于确保可信的评估至关重要。目前的评判基准通过任务类型对样本进行分类,但未能捕捉到可靠评估所需的基本判断能力。
为此,我们提出了M-JudgeBench,这是一种十维能力导向基准,旨在全面评估MLLM的判断能力。我们的基准将评估分解为成对的思维链(CoT)比较、避免长度偏差和过程错误检测任务,共同涵盖十个细粒度子任务。这一设计使得能够诊断模型在推理风格、响应长度和跨模型变化中的可靠性。
系统评估揭示了现有MLLM作为评判系统的系统性弱点。为了解决这个问题,我们进一步提出了Judge-MCTS,这是一个数据构建框架,生成具有不同正确性和长度的成对推理轨迹。通过Judge-MCTS,我们构建了一个增强的数据集,并训练了一系列强大的评判模型M-Judger。大量实验表明,M-Judger在现有评判基准以及M-JudgeBench上的表现优越。
总体而言,我们的工作通过M-JudgeBench和Judge-MCTS框架,为评估MLLM作为评判者建立了更为原则性的基础,为未来的评判模型评估和能力驱动的评判训练铺平了道路。
博主点评: 本文提出的M-JudgeBench和Judge-MCTS框架为多模态评判模型的评估提供了系统化的方法,尤其是在处理模型的可靠性和评估能力方面。这将为未来的研究提供重要的方向和基础。通过细化评估标准,本文有助于提升整个领域的可信度和实用性。