随着视觉语言模型(VLM)在多模态推理基准测试中越来越成功,其视觉证据在进入语言堆栈后往往变得不稳定,从而削弱了基于证据的推理。
为了理解这种脆弱性,我们通过机械视角考察了VLM的内部动态,揭示了多模态注意力聚焦在深度上的稳定三阶段重分配:早期的问题条件组织、关键的视觉主导中继和晚期的答案形成回归。
我们将中间阶段操作化为视觉中继窗口(VRW),并展示其几何形状随着任务需求而变化,与基础生成有因果关联,并区分不支持的答案与更强的推理轨迹。
在这种内部节奏的指导下,我们提出了TRACE,一种任务自适应推理时控制框架,具有轻量级训练模块。它在预填充期间重塑中继分配,并在解码过程中保留组装的视觉支持。
在四个开放权重的VLM骨干网络和七个基准测试中,TRACE在对基础敏感的设置中提供了显著提升,平均提高4.33分,最高可达6.6分,同时也改善了重推理任务。
这些结果表明,明确控制深度上的多模态聚焦为增强基于证据的多模态推理提供了一种统一而有效的机制。
博主点评: 本文提出的TRACE框架为视觉语言模型提供了新的思路,通过精细控制多模态聚焦来提升推理能力,尤其是在处理复杂的视觉证据时。该方法的有效性在多个基准测试中得到了验证,显示出其在实际应用中的潜力。未来的研究可以探索TRACE在其他领域的适用性,以及如何进一步优化其性能。