本文研究了在视觉语言模型(VLM)中,即使模型多次自我纠正、说出“等一下,我需要重新检查”,仍然可能给出错误答案却报告高置信度的现象。我们发现,这主要是因为在我们评估的 VLM 和校准方法中,口头表达的置信度对推理轨迹几乎没有依赖性。
我们从三个互补视角进行分析:
- 内容变化:改变推理过程中的细节,观察置信度是否随之波动。
- 标记遮蔽:遮盖推理过程中的关键 token,检测置信度的敏感度。
- 模型犹豫标记:利用模型自身的“思考中”标记,评估置信度与实际推理的关联。
实验表明,置信度对实际推理内容的敏感度不足,甚至在校准训练后,这种脱节会加剧。传统的校准评估指标如 ECE 和 AUROC 无法捕捉此类问题。为此我们提出了轨迹对齐得分(Trajectory‑Grounding Score,TGS),包括两种形式:
- TGS‑self:比较模型在有无自身推理轨迹信息时的置信度差异。
- TGS‑pair:在视觉、推理和答案三个维度上,检验模型是否对正确轨迹赋予更高置信度,而非错误轨迹。
基于此,我们构建了 TGS‑Bench,一个模型无关的基准套件,涵盖 10 项任务,每项任务提供受控的好/坏轨迹对。实验结果显示,传统校准排名与轨迹对齐排名存在显著分歧,揭示了当前评估实践中的盲点。
点评:本文通过系统实验揭示了 VLM 置信度与推理轨迹脱钩的根本原因,并提供了可操作的评估框架,为未来的模型校准研究指明了方向。