NeFut Logo NeFut
EN 管理员登录

[AI学术] DICA:双指标引导的多模态大语言模型对比对齐

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#AI #Machine Learning #DeepSeek

摘要

人类视觉推理通常遵循从全局场景理解到逐渐聚焦于与问题相关区域的粗到细的注意力过程。然而,多模态大语言模型可能因注意力漂移和视觉证据的不足利用而偏离这一模式,从而导致幻觉现象。为了解决这些问题,本研究提出了双指标引导的对比对齐(DICA),在推理过程中跟踪两个信息论指标:视觉注意力熵(VAE),反映视觉注意力的集中度,以及输出图像相关性(OIC),衡量生成输出与视觉输入的依赖关系。

VAE的异常增加或OIC的减少对应不同的失败模式,这会触发针对性的对比对齐以恢复视觉基础。实验结果表明,DICA在多个基准测试中持续超越现有方法,并显著减少幻觉现象,凸显了基于指标的干预在提高多模态推理可靠性方面的有效性。代码已公开发布在 GitHub

博主点评: DICA 的提出有效解决了多模态大语言模型中的视觉推理问题,通过引入信息论指标,增强了模型的视觉基础,使其在推理时更为可靠。该方法的实用性和有效性在多个基准测试中得到了验证,值得深入研究和应用。

原文链接: https://arxiv.org/abs/2607.23944

[h] 返回首页