强化学习(RL)常用于提升多模态大语言模型(MLLM)的推理能力,但对幻觉的抑制效果并不均衡。我们将问题追溯到奖励到参数更新的校正链中的两个薄弱环节。
在 rollout 阶段,语义熵高的硬查询往往产生全体错误的样本组,使得组相对优势在幻觉风险最高处坍塌为零。
在优化阶段,置信度高但错误的 token 对梯度不可见:当策略分布趋于尖锐时,分类策略的期望得分梯度范数趋于消失,导致最需要纠正的预测得到最弱的更新。
为此我们提出 双熵增强策略优化(DEEPO),采用双阶段增强:
-
语义熵触发的专家前缀在高不确定查询上注入有依据的续写,直接提供监督并恢复优势方差。
-
基于优势符号的 Rényi 预调节在 logits 层抵消饱和效应,使得在操作置信区间内的自信错误也能得到有效校正。
两条支路单独均优于 GRPO,且在 VideoMMMU(我们评估套件中最长时序任务)上交互效应显著提升 $+4.0$,95% 置信区间 [1.1, 6.9],其他任务上呈加和效果。DEEPO 在降低幻觉的同时保持准确性和训练稳定性。
点评:DEEPO 通过在高熵查询处引入外部专家信息并在梯度层面做细粒度调节,成功弥补了 RL 在幻觉抑制上的盲点,为多模态模型的可靠性提升提供了可行路径。