NeFut Logo NeFut
EN 管理员登录

[AI学术] OmniJudge 还是 OmniBias?通过平衡、解耦视角诊断多模态评判模型

发布于:2026-08-26 22:00 最后更新:2026-08-29 12:04
#AI #Machine Learning

多模态理解模型能够同时评判文本到图像(T2I)、文本到视频(T2V)和文本到语音(TTS)生成,正被广泛用作“OmniJudge”进行评估和自动标注。然而,现有基准和训练数据往往偏向正例,并且把不同的失效模式混在一起,使得模型即使得分很高,也可能未能识别出真实的错误,能力缺口难以暴露。

为了解决这一问题,本文提出 D3-Omni,一个平衡且解耦的细粒度多模态理解基准。它覆盖 53 个相互正交的二元维度(T2I 17、T2V 22、TTS 14),共计 10,671 条样本(T2I 3,526、T2V 1,998、TTS 5,147)。与其重新生成输出(可能在维度之间泄露信息),我们固定经过验证的全正例种子,并通过受控的提示改写和原子化、维度隔离的扰动生成负例。

D3 设计具备三大特性:

该套件实现了几乎 1:1 的每维度正负样本比例,并在所有总分层级上保持均匀分布。基于这种平衡视角,即使是强大的 OmniJudge 在模态相关维度上仍表现不佳;它们更擅长确认满足的要求,而不是检测被违背的要求;并且倾向于把名义上不同的属性视为单一决策。由此可见,聚合准确率可能掩盖系统性的盲点,而平衡、解耦的视角能够帮助揭示并进一步改进这些盲点。

博主点评:D3‑Omni 通过严格的正负样本构造和维度解耦,为多模态评判模型提供了更可信的诊断手段。它提醒我们,单纯的整体准确率并不足以评估模型真实能力,细粒度的平衡基准是发现并弥补模型盲区的关键。

原文链接: https://arxiv.org/abs/2608.24160

[h] 返回首页