NeFut Logo NeFut
EN 管理员登录

[AI学术] 超越表层模仿:对比建模用于多模态上下文学习中的推理路径对齐

发布于:2026-09-11 22:00 最后更新:2026-09-12 06:35
#Machine Learning #LLM #Artificial Intelligence

在多模态大语言模型(MLLM)中,上下文学习(ICL)已成为提升各类任务性能的关键手段。但现有方法多依赖对示例的表层模仿,模型难以将输出对齐到输入所需的推理路径,尤其在复杂任务上表现受限。为此我们提出一种结合对比示例建模与模型自我精炼的 ICL 框架。框架核心是将每条示例重新表述为:在相同输入下,对比一个次优答案与一个更优答案,并给出一条推理路径,说明如何将次优答案改进为更优答案。该对比形式使得期望的推理过程更加显式,促使模型超越表层模仿。由于精炼过程依赖当前答案,我们设计了响应条件检索机制,依据当前答案挑选推理路径更相关的示例。另引入轻量对齐控制器,预测答案质量并决定是否继续精炼。实验在视觉问答等三类多模态任务上验证了该框架的普适提升,尤其在 VQA 上取得显著增益。

点评

原文链接: https://arxiv.org/abs/2609.10177

[h] 返回首页