当前的大型多模态语言模型(MLLMs)可以处理多种感官输入,但其推理仍然严重偏向于主导模态,导致跨模态推理脆弱。我们引入了 C$^3$PO 基准测试,包含 3,404 个样本,涵盖视频、音频、图像和文本,评估两个能力:信息组合(融合分散的证据)和反事实冲突(解决故意的矛盾)。C$^3$PO 的配对 IC/CC 结构和四级设计使得可以对跨模态推理失败的原因和时机进行有针对性的诊断。通过使用 25 个逻辑模板的全自动流水线构建,C$^3$PO 显示人类可以达到 88.64% 的准确率,而最好的模型(Gemini-3.1-Pro)仅达到 73.17%。通过注意力探针,我们发现 86-95% 的失败是由于模态主导:模型专注于一种模态,同时忽略矛盾的证据,集中 87-95% 的注意力在文本上。中层注意力熵可以预测正确性——持续的探索可以成功,而过早的崩溃会失败。同等复杂的模板之间的 56 个准确率差距表明,性能取决于模态在冲突解决中的结构角色,而不是组合。这些发现表明,多模态感知不保证强大的推理;架构必须支持持续的跨模态注意力,以避免过早的崩溃。 博主点评: C$^3$PO 基准测试揭示了当前多模态语言模型的局限性,强调了跨模态注意力和冲突解决能力的重要性。未来研究应聚焦于开发更强大的跨模态推理模型和架构,以应对复杂的现实世界问题。