Audio-Visual 大语言模型(AV‑LLM)仍然容易出现跨模态幻觉,即一种模态错误影响另一模态的预测。对比解码虽能降低视觉语言模型的幻觉,但直接迁移到 AV‑LLM 时忽略了关键问题:不同提问需要不同的感知证据,可能是音频、视频或两者交互。我们发现,即使模型能够仅凭单一模态得到正确答案,联合音视频推理也可能削弱预测。例如,询问“听到的乐器是什么”时,仅凭音频模型能正确预测小提琴;但加入显示吉他的视频后,模型对小提琴的置信度会下降。
为此本文提出 Relevant Evidence Decoding(RED),一种无需额外训练的解码策略。RED 通过点对点互信息(PMI)衡量音频和视频在给定问题之外对预测的支持力度,并将它们的联合贡献分解为音频、视频和残差交互三部分。首先进行一次仅含问题的推理,以判断所需的证据类型;随后在原始音视频预测上加上对应的 PMI 贡献,从而有选择地强化相关证据。
在三个音视频幻觉基准(CMM、AVHBench、SVHalluc)以及三种 AV‑LLM 上实验表明,RED 相比标准解码在准确率上分别提升最高 7%(CMM)、6.3%(AVHBench)和 3.8%(SVHalluc),且平均首 token 时间约为标准解码的 1.5 倍。
点评