多模态大语言模型(LLM)在科学推理基准上表现出色,但多数工作将感知与推理视为统一的可测过程。我们设计了一个包含五个任务的诊断实验,覆盖物理和几何两个领域,能够分别定位感知失误、推理失误或两者共同导致的错误。
实验发现,即使模型能够仅凭文本解答正确,错误的图示解释也会显著降低其整体准确率;从原始图像到人工撰写的文字说明,准确率普遍提升。对部分模型而言,使用纠正后的文字说明后能够显著恢复性能,这表明部分错误是感知阻断导致的,而非真正的推理瓶颈。
进一步分析显示,感知失误后出现的推理错误在物理任务中多表现为计算错误,而在几何任务中则倾向于概念误用。作为对核心实验的补充讨论,InternS1‑mini 虽经大量科学预训练并具备思考能力,但在所有任务上均不及实验中最弱的模型,其推理轨迹常在完成前被截断。
点评: 该工作提供了细粒度的诊断框架,帮助研究者区分感知层面的噪声与真正的推理瓶颈,为多模态模型的改进指明了方向。