NeFut Logo NeFut
EN 管理员登录

[AI学术] 锚定关键:面向视觉多模态推理的双层学习框架

发布于:2026-09-17 22:00 最后更新:2026-09-18 00:46
#AI #Machine Learning #optimization

强化学习与可验证奖励(RLVR)显著提升了大规模视觉语言模型(LVLM)的推理能力。但传统的在线RLVR算法在保持和强化视觉落地推理行为时存在关键瓶颈:有价值的视觉推理轨迹在一次更新后即被丢弃,且统一的 token 优势分配无法让模型重点强化关键的感知或推理步骤。

为了解决上述问题,本文提出 PIVOT——一种双层学习框架,围绕信息丰富的视觉推理信号锚定策略优化。首先,PIVOT 引入自校准经验回放机制,选择性地收集并重放历史的视觉落地经验,将其作为稳定的参考锚点供策略优化使用。随后,基于此设计了视觉引导的优势分配机制,根据每个 token 的局部视觉支持程度及其对下游推理的影响,分配额外的视觉感知优势,从而让模型在关键视觉步骤上获得更大强化。

在多个公开基准上的实验表明,PIVOT 能显著提升 LVLM 的多模态推理能力,性能与最先进方法相当甚至超越。

点评:PIVOT 通过经验回放和视觉感知优势双重手段,有效缓解了在线 RLVR 的信息丢失问题,为视觉多模态推理提供了更稳健的学习路径。

原文链接: https://arxiv.org/abs/2609.18057

[h] 返回首页