多模态理解模型能够同时评判文本到图像(T2I)、文本到视频(T2V)和文本到语音(TTS)生成,正被广泛用作“OmniJudge”进行评估和自动标注。然而,现有基准和训练数据往往偏向正例,并且把不同的失效模式混在一起,使得模型即使得分很高,也可能未能识别出真实的错误,能力缺口难以暴露。
为了解决这一问题,本文提出 D3-Omni,一个平衡且解耦的细粒度多模态理解基准。它覆盖 53 个相互正交的二元维度(T2I 17、T2V 22、TTS 14),共计 10,671 条样本(T2I 3,526、T2V 1,998、TTS 5,147)。与其重新生成输出(可能在维度之间泄露信息),我们固定经过验证的全正例种子,并通过受控的提示改写和原子化、维度隔离的扰动生成负例。
D3 设计具备三大特性:
- Dual‑balanced:缓解负样本稀缺和每个维度标签不平衡;
- Decoupled:每个错误仅归因于单一能力;
- Dynamic:随着生成模型的提升,构造过程会主动向标签分布的不足区域倾斜。
该套件实现了几乎 1:1 的每维度正负样本比例,并在所有总分层级上保持均匀分布。基于这种平衡视角,即使是强大的 OmniJudge 在模态相关维度上仍表现不佳;它们更擅长确认满足的要求,而不是检测被违背的要求;并且倾向于把名义上不同的属性视为单一决策。由此可见,聚合准确率可能掩盖系统性的盲点,而平衡、解耦的视角能够帮助揭示并进一步改进这些盲点。
博主点评:D3‑Omni 通过严格的正负样本构造和维度解耦,为多模态评判模型提供了更可信的诊断手段。它提醒我们,单纯的整体准确率并不足以评估模型真实能力,细粒度的平衡基准是发现并弥补模型盲区的关键。