NeFut Logo NeFut
EN 管理员登录

[AI学术] 感知迷失:多模态物理与几何推理中的感知与推理失效分离

发布于:2026-09-18 22:00 最后更新:2026-09-20 12:54
#AI #Machine Learning #LLM

多模态大语言模型(LLM)在科学推理基准上表现出色,但多数工作将感知与推理视为统一的可测过程。我们设计了一个包含五个任务的诊断实验,覆盖物理和几何两个领域,能够分别定位感知失误、推理失误或两者共同导致的错误。

实验发现,即使模型能够仅凭文本解答正确,错误的图示解释也会显著降低其整体准确率;从原始图像到人工撰写的文字说明,准确率普遍提升。对部分模型而言,使用纠正后的文字说明后能够显著恢复性能,这表明部分错误是感知阻断导致的,而非真正的推理瓶颈。

进一步分析显示,感知失误后出现的推理错误在物理任务中多表现为计算错误,而在几何任务中则倾向于概念误用。作为对核心实验的补充讨论,InternS1‑mini 虽经大量科学预训练并具备思考能力,但在所有任务上均不及实验中最弱的模型,其推理轨迹常在完成前被截断。

点评: 该工作提供了细粒度的诊断框架,帮助研究者区分感知层面的噪声与真正的推理瓶颈,为多模态模型的改进指明了方向。

原文链接: https://arxiv.org/abs/2609.18991

[h] 返回首页