多模态大语言模型(MLLM)在回答需要大量知识的视觉问答时,需要同时利用图像中的视觉证据和外部检索到的文本事实。然而,模型常常忽视关键证据,对答案所需的文本句子或视觉区域关注不足。已有方法通过在生成前高亮检索文本或标记视觉区域来缓解,但它们采用固定的一次性策略,无法适应三类变化:是否需要高亮、不同样本所需证据量以及答案生成过程中何时需要更新文本证据。\
我们提出 自适应相关性引导证据分配(AREA),这是一种在推理时无需额外训练的自适应高亮方法。AREA 首先在固定的主干层生成一个探针 token,用以读取视觉和文本的相关性分数,然后依据三条准则做出决策:\
- 是否介入:通过自然注意力覆盖率和视觉汇聚(sink)污染程度判断是否需要干预;\
- 证据量多少:依据相关性熵(relevance entropy)决定向模型暴露多少证据;\
- 何时刷新文本:当因果上下文注意力出现峰值时触发文本更新。\
在四个知识库视觉问答(KB‑VQA)数据集和七个标准多模态基准上,使用九个冻结的 MLLM 检查点进行实验,AREA 在所有训练无关的高亮方法中取得了最佳性能。\
点评