在多模态大语言模型中,图像或语音有时会与随附的文本产生冲突。传统的文本偏好度量往往把模态偏好和证据顺序混在一起,导致难以分辨是哪一种因素主导了模型的答案。早期研究要么固定证据顺序,要么把任务指令与证据一起移动,这使得顺序的真实影响难以评估。
本文采用配对比较的实验设计:保持任务指令和证据内容不变,仅交换图像(或语音)与文本的出现顺序。这样可以直接量化顺序对模型判断的潜在影响。实验在多种视觉模型和语音模型上进行,结果显示:当冲突的图像或录音被放在文本之后时,模型的答案会显著倾向于后出现的感知信息。
我们进一步回顾了之前的工作,分析了它们的实验设置为何可能导致误导性的结论。总体而言,这些发现揭示了一种跨模态的证据非交换性:相同的证据在顺序改变后会产生不同的判断,而把感知证据放在后面会提升模型对该证据内容的依赖程度。
点评