NeFut Logo NeFut
EN 管理员登录

[AI学术] ST-Veto:通过泰勒预测与视觉定位提升扩散多模态大语言模型的时空令牌管理

发布于:2026-07-22 22:00 最后更新:2026-07-23 12:33
#AI #Machine Learning #optimization

摘要

视觉语言模型(VLMs)在链式思维(CoT)提示下表现出强大的推理能力,但面临高昂的顺序生成成本、错误累积和有限的自我修正能力。扩散多模态大语言模型(dMLLMs)通过无序生成的方式逐步揭示令牌,提升了效率并实现了迭代优化,但其推理能力及增强方法仍未得到充分研究。

我们提出了一种无训练的方法——时空令牌否决(ST-Veto),该方法利用在每个扩散步骤中观察所有令牌位置的能力。ST-Veto并非仅依赖当前步骤的置信度,而是通过对置信度动态的二阶泰勒预测来否决时序不稳定的令牌,并利用图像注意力质量过滤弱定位的令牌,替换为更安全的候选令牌。

在多个dMLLM和多模态推理基准测试中,ST-Veto始终优于标准解码策略和之前的VLM推理方法,准确率提高了最多9%,且没有额外的训练或生成成本。分析表明,ST-Veto引导生成朝向更高置信度和更好定位的路径。

博主点评: ST-Veto方法通过创新的泰勒预测和视觉关注机制,有效提升了扩散多模态大语言模型的推理效率,展示了在无需额外训练下增强模型性能的潜力。这为未来的多模态学习研究提供了新的视角和方法论,值得深入探索与应用。

原文链接: https://arxiv.org/abs/2607.17884

[h] 返回首页