摘要
自回归多模态大型语言模型(MLLMs)面临错误雪崩的问题:在链式思维(CoT)推理的早期出现的单个错误会导致后续推理全部受损。我们发现,在最先进的开源 MLLMs 中,一旦发生第一个错误,65% 的情况下推理会级联失败(我们称之为雪崩率)。现有的缓解措施——如采样多个链、事后自我验证或完整程序合成——要么缺乏符号基础,要么在错误发生时才被捕获,或者牺牲了自然语言推理的灵活性。
我们提出了约束锚定推理轨迹(CART),这是一种神经符号框架,旨在训练 MLLMs 交替进行自然语言推理步骤和符号约束声明:关于视觉内容的轻量化、可机器检查的语句(例如,count(red_objects) = 3)。一个双重约束传播模块结合了学习的神经基础头和布尔约束传播,持续验证这些锚点与提取的视觉特征,并检查它们之间的逻辑一致性。当检测到矛盾时,回溯控制器会停止生成并回退到上一个一致的检查点,从而防止错误传播。
一个可变频率发射机制允许模型自适应地控制锚点密度,避免轨迹膨胀。我们通过增强 GQA、CLEVR-CoGenT 和 VCR,并从场景图中导出真实约束注释,构建了 218K 训练实例,并通过 LoRA 微调开源 MLLMs(LLaVA-NeXT, Qwen2-VL)。在五个基准测试中,CART 将雪崩率从 0.65 降低到 0.14,GQA 准确率比仅训练基线提高了 4.6 个百分点,并在 POPE-all 中达到了 89.1 的 F1 分数,推理开销最多为 18%。
博主点评: 约束锚定推理轨迹(CART)通过结合神经网络和符号逻辑的优势,显著降低了自回归模型的错误传播风险,展现了在多模态推理中提高准确性和稳定性的潜力。这一创新方法为未来的 MLLM 研究提供了新的方向。