NeFut Logo NeFut
EN 管理员登录

[AI学术] 透视潜在视觉推理:让潜在视觉推理成为必要

发布于:2026-09-11 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #Neural

潜在视觉推理的目标是通过隐藏状态的计算完成多模态推理,而不是依赖显式的文字思考链。然而,仅仅把视觉信息放入隐藏状态并不保证模型在生成答案时真正利用了该状态,尤其是当还有其他基于图像的路径可用时。我们提出 因果视觉递归推理(Causal Visual Recurrent Reasoning,CVRR),在保持预训练视觉语言模型能力的前提下,强制递归计算成为唯一的图像条件路径。CVRR 在预训练模型已经融合图像后,从问题的隐藏状态初始化递归,然后在固定的视觉证据上反复读取并更新该状态。解码前,所有视觉状态和原始的多模态 KV 缓存被移除,仅保留最终的递归状态携带图像信息进入答案生成。实验在 $V^*$、MMVP、BLINK 和 MME-RealWorld-Lite 基准上进行,CVRR 在这种严格接口下仍保持强劲表现,而在相同约束下重新训练的兼容潜在推理器则难以恢复可比的视觉能力。因果干预实验表明,当问题保持不变时,预测仍对递归内容敏感;持续的视觉证据会因果性地改变递归轨迹。这些结果区分了潜在信息的存在与实际用于预测的潜在计算。

点评

原文链接: https://arxiv.org/abs/2609.06746

[h] 返回首页