NeFut Logo NeFut
EN 管理员登录

[AI学术] Groc-PO:为真实多模态LLM优化的基础上下文偏好框架

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:19
#AI #Machine Learning #Open Source

摘要

尽管多模态大型语言模型(MLLMs)迅速发展,但仍面临不真实的问题,例如视觉幻觉、内容虚构和不可靠推理,这些问题严重影响了它们的可信度和实用性。基于人类偏好的对齐方法,如直接偏好优化(DPO),已被广泛采用来解决这些问题。然而,多模态推理错误往往在各个阶段传播,最终答案的错误通常可以追溯到早期基础阶段的错误,而标准的DPO通常在最终答案层面进行偏好优化。这种信用分配挑战意味着早期基础阶段的监督是间接的,而非阶段特定的,这使得抑制由于基础漂移和上下文不一致引起的错误传播变得困难。

为了解决这个问题,我们提出了基础上下文偏好优化(Groc-PO),这是一个针对MLLMs的基础偏好优化框架。我们进一步构建了基础上下文偏好数据集(GCPD),围绕对象基础、上下文基础和基础推理三个阶段组织多阶段偏好样本,以捕捉基础上下文的形成、整合和利用。通过在多个基础阶段引入更明确的偏好监督,Groc-PO增强了上下文依赖的推理能力,并减轻了跨阶段错误传播。大量实验表明,与标准DPO和其他强基线相比,Groc-PO在减轻幻觉、可信推理和整体可靠性方面表现更佳,支持了更明确的基础监督在可信多模态推理中的价值。

博主点评: Groc-PO通过引入多阶段的偏好优化,显著提升了多模态LLMs在复杂推理中的表现,尤其是在处理视觉和文本信息时的可信度。这一方法为未来的模型设计提供了新的思路,强调了基础阶段的监督重要性,值得深入研究与应用。

原文链接: https://arxiv.org/abs/2607.13712

[h] 返回首页