摘要
尽管多模态大型语言模型(MLLMs)迅速发展,但仍面临不真实的问题,例如视觉幻觉、内容虚构和不可靠推理,这些问题严重影响了它们的可信度和实用性。基于人类偏好的对齐方法,如直接偏好优化(DPO),已被广泛采用来解决这些问题。然而,多模态推理错误往往在各个阶段传播,最终答案的错误通常可以追溯到早期基础阶段的错误,而标准的DPO通常在最终答案层面进行偏好优化。这种信用分配挑战意味着早期基础阶段的监督是间接的,而非阶段特定的,这使得抑制由于基础漂移和上下文不一致引起的错误传播变得困难。
为了解决这个问题,我们提出了基础上下文偏好优化(Groc-PO),这是一个针对MLLMs的基础偏好优化框架。我们进一步构建了基础上下文偏好数据集(GCPD),围绕对象基础、上下文基础和基础推理三个阶段组织多阶段偏好样本,以捕捉基础上下文的形成、整合和利用。通过在多个基础阶段引入更明确的偏好监督,Groc-PO增强了上下文依赖的推理能力,并减轻了跨阶段错误传播。大量实验表明,与标准DPO和其他强基线相比,Groc-PO在减轻幻觉、可信推理和整体可靠性方面表现更佳,支持了更明确的基础监督在可信多模态推理中的价值。
博主点评: Groc-PO通过引入多阶段的偏好优化,显著提升了多模态LLMs在复杂推理中的表现,尤其是在处理视觉和文本信息时的可信度。这一方法为未来的模型设计提供了新的思路,强调了基础阶段的监督重要性,值得深入研究与应用。