在视频大语言模型(LLMs)的基准测试中,准确性常被视为视觉理解的证据。我们对跨越20个模型(参数规模从2亿到78亿)和十种架构类别的这一假设进行了审计。我们引入了视觉依赖差距(Visual Dependency Gap, VDG),即原始视频与黑屏条件下每个问题的正确性差异。通过在MVBench上进行配对的McNemar检验,结果显示准确性与视觉依赖是可分的:模型在原始视频上的表现显著不同(p = 0.0003),而在黑屏上的表现则无显著差异(p = 0.53)。
在不同模型中,任务类型的排名稳定:属性感知(Attribute Perception)强烈依赖视觉,而时间推理(Temporal Reasoning)接近语言基线。通过从黑屏到单帧、打乱帧和原始视频的诊断阶梯发现,帧的多样性提供了大部分视觉收益,而时间顺序对准确性几乎没有贡献。通过0.5到24帧每秒的消融实验排除了稀疏采样作为原因。H.264实验进一步表明,稳定的整体准确性掩盖了双向问题级答案的反转。这一诊断方法同样适用于四个API访问的模型,其VDG值范围在0.025到0.315之间。这些结果促使我们将VDG作为一种标准审计工具,以评估视频基准是否衡量了视觉基础能力。代码可在 GitHub 获取。
博主点评: 该研究揭示了当前视频大语言模型基准测试的局限性,强调了准确性与视觉理解之间的脱节。提出的VDG指标为未来的模型评估提供了新的视角,值得在相关领域广泛应用。