摘要
与展现出强大推理能力的大型语言模型(LLMs)相比,视觉语言模型(VLMs)在视觉推理方面存在困难,尤其是在几何问题上,这些问题有文本、图示和结合文本+图示的等价视图。
我们发现,这些视图往往会引发不同的行为:模型可能在文本中解决问题但在对应的图示上失败,或在视觉上成功而在文本上失败。这种不一致性表明,不同的视图暴露了互补的推理路径和标准多模态后训练未能充分利用的失败模式。
为研究和利用这一现象,我们构建了 ODA-Data,这是一个高质量的配对多模态几何数据集,包含文本主导、图像主导和结合图像+文本视图的相同问题,以及用于训练和评估模态依赖推理行为的划分。
随后,我们开发了基于强化学习的 MIRROR(模态信息互惠推理优化)方法,通过自我监督来改善多模态推理。
对于每个问题,MIRROR 在所有视图下评估模型,选择表现最佳的视图作为教师,并通过反向 KL 目标训练其他视图。通过评估几何问题的推理基准,MIRROR 相较于标准的强化学习方法,提供了更准确和一致的跨模态行为。
博主点评: MIRROR 模型通过自我监督和模态互惠的方式,显著改善了视觉语言模型的推理能力,展示了不同视图间的互补性对提升模型性能的重要性。这一方法为未来多模态推理研究开辟了新的方向。