NeFut Logo NeFut
EN 管理员登录

[AI学术] 视觉-语言模型推理中的视觉访问边界研究

发布于:2026-07-15 22:00 最后更新:2026-07-17 08:46
#algorithm #AI #Machine Learning

摘要

链式思维(CoT)提示作为视觉-语言模型(VLMs)在测试时的扩展策略被广泛使用,但其在生成更长推理轨迹时的扩展性尚不明确。我们探讨了CoT是否需要持续访问图像令牌,还是主要依赖于前向传播中早期可用的视觉信息。

我们引入了视觉访问扫掠(Visual Access Sweep),这是一种因果干预,掩蔽从生成令牌查询到图像令牌键的注意力,沿着层深度和生成时间定义视觉访问边界(VAB),即保持任务准确性所需的最小访问区域。在Qwen2.5-VL和InternVL3的六种模型配置中,无CoT直接回答和CoT提示均表现出有限的VAB。在Qwen2.5-VL-32B和InternVL3的14B和38B规模中,当CoT与无CoT的完全访问目标进行评估时,其VAB层与无CoT边界最多相差两层,尽管生成的长度显著增加。这表明,CoT的性能并不是通过延长直接图像令牌访问来改善,而是通过扩展对图像衍生的隐藏状态信息的语言侧计算。

我们进一步展示了CoT增益受到感知读取的限制。当查询的视觉属性可以被模型可靠读取时,CoT有助于推理;但当读取不可靠时则无效。一个符号属性的oracle显示,当真实属性作为文本提供时,CoT能够改善计数,而单对象探测与解码检查显示,硬属性可以从隐藏状态中线性恢复,但模型自身输出却困难重重。综上所述,这些分析将瓶颈放在了读取而非计数上。

博主点评: 本文深入探讨了视觉-语言模型中链式思维的有效性,提出的视觉访问边界概念为理解模型推理提供了新视角,尤其是在处理复杂视觉信息时,强调了模型对信息读取的依赖性。研究结果提示我们在设计更强大的VLM时,需要关注信息的可读取性与模型的推理能力之间的平衡。

原文链接: https://arxiv.org/abs/2607.12815

[h] 返回首页