摘要
链式思维(CoT)提示作为视觉-语言模型(VLMs)在测试时的扩展策略被广泛使用,但其在生成更长推理轨迹时的扩展性尚不明确。我们探讨了CoT是否需要持续访问图像令牌,还是主要依赖于前向传播中早期可用的视觉信息。
我们引入了视觉访问扫掠(Visual Access Sweep),这是一种因果干预,掩蔽从生成令牌查询到图像令牌键的注意力,沿着层深度和生成时间定义视觉访问边界(VAB),即保持任务准确性所需的最小访问区域。在Qwen2.5-VL和InternVL3的六种模型配置中,无CoT直接回答和CoT提示均表现出有限的VAB。在Qwen2.5-VL-32B和InternVL3的14B和38B规模中,当CoT与无CoT的完全访问目标进行评估时,其VAB层与无CoT边界最多相差两层,尽管生成的长度显著增加。这表明,CoT的性能并不是通过延长直接图像令牌访问来改善,而是通过扩展对图像衍生的隐藏状态信息的语言侧计算。
我们进一步展示了CoT增益受到感知读取的限制。当查询的视觉属性可以被模型可靠读取时,CoT有助于推理;但当读取不可靠时则无效。一个符号属性的oracle显示,当真实属性作为文本提供时,CoT能够改善计数,而单对象探测与解码检查显示,硬属性可以从隐藏状态中线性恢复,但模型自身输出却困难重重。综上所述,这些分析将瓶颈放在了读取而非计数上。
博主点评: 本文深入探讨了视觉-语言模型中链式思维的有效性,提出的视觉访问边界概念为理解模型推理提供了新视角,尤其是在处理复杂视觉信息时,强调了模型对信息读取的依赖性。研究结果提示我们在设计更强大的VLM时,需要关注信息的可读取性与模型的推理能力之间的平衡。