摘要
现代视觉语言模型(VLMs)越来越依赖动态或高分辨率的视觉编码,生成成千上万的视觉令牌,这大大增加了下游语言模型的推理成本。现有的令牌减少方法通过令牌重要性、查询相关性、覆盖率、成对多样性或子集级目标来评估令牌的有效性。
我们的关键见解是通过选定的跨度互补性来看待视觉令牌的减少:与其孤立地评分令牌或通过成对关系来评估,不如评估其特征与已保留子集的跨度之间的正交性。基于这一视角,我们提出了贪婪正交令牌选择(GOTS),这是一种无训练且与查询无关的方法。在每一步中,GOTS选择与当前保留跨度正交的最大残余能量的令牌。这个规则精确地最大化了候选添加中的一步增广Gram行列式,为子集扩展的每个贪婪步骤提供了精确的局部几何保证。
在Qwen-VL和InternVL系列的五个高分辨率VLM骨干网络以及十一项多样化基准测试中,GOTS实现了比最强基线更高的平均性能保留,并且在控制的OCRBench研究中,显示其在考虑选择开销后减少了模型端的首次令牌时间。代码可在 GitHub 获取。
博主点评: GOTS方法通过正交性视角重新定义了令牌选择过程,显著提升了高分辨率视觉语言模型的效率,展示了在复杂任务中的强大潜力。其无训练的特性使其更具实用性,值得在更多应用场景中进行深入探讨。