在视觉认知中,人类的观察是一个闭环:目光不断被中间假设重定向,而不是单一的快照。几十年的心理物理学和认知科学研究表明,这种主动观察对多种任务至关重要。然而,当前的多模态大型语言模型(MLLMs)是否具备主动观察能力仍然是一个经验性问题,而现有的视觉-语言基准并未解答这一点。
为此,我们引入了 ActiveVision 基准,旨在使 MLLMs 的主动观察能力可衡量。该基准包含 17 个任务,分为 3 个类别,任务设计旨在强迫模型进行重复的视觉感知,而不是单一的静态描述。在 ActiveVision 上,前沿的 MLLMs 表现不佳:我们评估的最高得分模型 GPT-5.5,在最高的推理努力层级中,仅解决了 10.6% 的项目,并且在 17 个任务中有 11 个得分为零;而 Claude Fable 5,尽管在多数推理和编码排行榜上名列前茅,却仅解决了 3.5%,远远落后于三名人类参与者,他们的平均得分为 96.1%。
此外,即使模型能够编写和运行自己的视觉代码,这一差距依然显著:这些代码在处理真实图像时并不可靠,而捕捉其失败本身需要模型所缺乏的主动感知能力。综合这些结果表明,当前的 MLLMs 缺乏稳健的主动视觉观察能力,这促使我们重新思考架构和训练目标,以缩小感知与推理之间的循环差距。
博主点评: 当前的研究揭示了 MLLMs 在视觉理解上的重大短板,强调了主动观察在认知中的重要性。未来的模型设计应更加注重感知与推理的紧密结合,以提升其在复杂任务上的表现。