视觉语言模型(VLM)在多模态推理上取得了显著成绩,但仍容易生成看似合理却错误的答案。自我验证是一种无需外部评判者即可提升答案可靠性的实用手段,然而现有方法通常依赖单一验证准则或固定提示,导致可靠性评估不完整且不稳定。我们系统地分析了验证器能力和提示设计对验证性能的影响,发现更强的验证器能提供更可靠的判断,而验证性能对提示选择高度敏感,暂无单一提示在所有任务上始终占优。基于这些发现,我们提出了 MOTIVE(Multi‑View Self‑Verification with Reliability‑Guided Rethinking)框架。MOTIVE 从互补的验证视角评估每个候选答案,并通过基于正确性的多视角验证学习得到与正确性对齐的可靠性得分。推理时,该得分决定“接受‑或‑重新思考”决策:可靠答案直接返回,不确定答案触发基于历史的重新思考。大规模实验覆盖多种多模态基准和 VLM 主干,结果表明 MOTIVE 持续超越强基线的自我验证和自我纠正方法。进一步的分析显示,可靠的验证提升了接受‑或‑重新思考的决策质量,减少了不必要的推理轮次,实现了在无需外部评判者的情况下更可靠且高效的自我验证。
点评