Multimodal 大语言模型在视觉数学推理时常因感知粒度不足而产生视觉幻觉,这些幻觉会直接触发后续的推理错误。
传统的端到端强化学习使用稀疏奖励,难以将感知错误与逻辑失误解耦,导致难以针对性地提升感知能力。另一方面,使用感知增强的Chain-of-Thought 微调需要大量标注数据,成本高且仍会出现幻觉。
本文提出 UniCAR-RL,一个无需人工标注的强化学习框架。它通过在训练过程中显式分离感知优化和推理优化,实现两者的独立提升。
UniCAR-RL 包含三条协同分支:
- Caption-RL 分支利用验证器引导的推理校验来优化感知能力;
- Reasoning-RL 分支基于金标准图像描述进行逻辑推理,以阻断错误传播;
- QA-RL 分支保持原始端到端对齐,确保问答性能稳健。
实验表明,仅使用原始的简短答案数据,UniCAR-RL 就能显著提升模型的数学和视觉推理准确率,并在不同网络结构和规模上展现出强泛化能力。
该工作展示了通过感知‑推理解耦实现视觉数学推理的可行路径,为后续的多模态大模型优化提供了新思路。
点评:UniCAR-RL 通过结构化的 RL 设计,有效抑制了感知幻觉对推理的连锁影响,兼顾了数据效率和模型通用性,是视觉数学领域的一个重要突破。