NeFut Logo NeFut
EN 管理员登录

[AI学术] 颠覆认知的视觉语言模型:问题回声解决了提问优先悖论

发布于:2026-07-20 22:00 最后更新:2026-07-22 01:01
#AI #Machine Learning #Open Source

摘要

在视觉语言模型(VLM)的提示中,问题应放在图像之前还是之后?直觉上应该放在前面:知道问题是什么应该能引导模型的关注。然而,在视觉问答基准测试中,问题优先的提示方法在效果上始终不如建议的图像优先顺序,这一现象被称为提问优先悖论。

我们追溯这个悖论,发现它源于VLM计算的两个阶段之间的冲突。通过logit-lens和注意力探针,我们发现放在图像之前的问题确实可以引导感知,将图像补丁表示向问题相关的概念移动。但问题的失败发生在后续阶段:在数百个图像标记后,问题几乎没有被答案标记关注,答案标记倾向于依赖图像驱动(通常是错误的)答案;因果注意力消融实验确认,仅当问题在图像之后时,答案才会读取问题。

这一诊断提供了无需训练的解决方案:问题回声,即在图像的两侧重复问题,使得一份问题引导感知,而另一份在回答时被读取。这样的分工在五十年前有关人类“附加问题”的研究中也有所体现:在段落前后重复问题比单独放在任何一个位置更有助于理解。同时,回声图像也带来了进一步的增益,恢复了因果解码器本来会丢失的整体图像视图。

这一悖论在五个开放的VLM上均存在,导致最多17.5的群体准确率下降。回声提示能够缩小这一差距,并在NaturalBench、POPE、Winoground和开放式VQAv2上超越最佳单次通过的顺序,提升最多19个Winoground群体准确率,且无需训练、微调或架构更改。该悖论揭示了引导感知与保持问题访问之间的权衡;而回声设计仅通过提示设计就解决了这一问题。

博主点评: 本文通过深入分析视觉语言模型中的提问优先悖论,提出了问题回声的概念,展示了如何通过简单的提示设计优化模型性能。这一研究不仅为理解VLM的内部机制提供了新视角,也为今后的模型设计提供了重要启示。其方法的实用性和有效性值得在更广泛的应用中推广。

原文链接: https://arxiv.org/abs/2607.15565

[h] 返回首页