Reinforcement Learning with Verifiable Rewards (RLVR) 已经提升了多模态大语言模型的推理能力,但现有框架仅使用序列级奖励,缺乏对视觉依赖的细粒度监督。我们从两个 token 级别指标出发:视觉依赖度(衡量 token 预测对图像特征的依赖)和预测熵。实验发现:① 正确推理链在视觉依赖增强时熵下降更陡峭;② 关键 token 在视觉依赖‑熵联合分布中是异常点,其错误会导致推理崩溃。基于此我们提出 Token‑level Perception‑grounded Advantage Estimation (TPAE),通过比较每个 token 与正确 rollout 的视觉‑熵模式的一致性来估计优势,并用该粒度分数调节序列级优势,从而为 RLVR 提供细粒度监督。TPAE 可无缝嵌入现有 RLVR 框架。七个基准实验表明,TPAE 稳定提升性能,优化更高效。代码:https://github.com/Zhihan72/TPAE。
点评