摘要
视觉语言模型(VLMs)在链式思维(CoT)提示下表现出强大的推理能力,但面临高昂的顺序生成成本、错误累积和有限的自我修正能力。扩散多模态大语言模型(dMLLMs)通过无序生成的方式逐步揭示令牌,提升了效率并实现了迭代优化,但其推理能力及增强方法仍未得到充分研究。
我们提出了一种无训练的方法——时空令牌否决(ST-Veto),该方法利用在每个扩散步骤中观察所有令牌位置的能力。ST-Veto并非仅依赖当前步骤的置信度,而是通过对置信度动态的二阶泰勒预测来否决时序不稳定的令牌,并利用图像注意力质量过滤弱定位的令牌,替换为更安全的候选令牌。
在多个dMLLM和多模态推理基准测试中,ST-Veto始终优于标准解码策略和之前的VLM推理方法,准确率提高了最多9%,且没有额外的训练或生成成本。分析表明,ST-Veto引导生成朝向更高置信度和更好定位的路径。
博主点评: ST-Veto方法通过创新的泰勒预测和视觉关注机制,有效提升了扩散多模态大语言模型的推理效率,展示了在无需额外训练下增强模型性能的潜力。这为未来的多模态学习研究提供了新的视角和方法论,值得深入探索与应用。