On‑policy 强化学习是提升大语言模型推理能力的核心范式,但奖励稀疏限制了效果。当模型在困难问题上找不到正确轨迹时,优化几乎得不到信号,容易停滞。已有方法通过离线示例、专家轨迹或模型生成的解来缓解,但通常要求辅助数据与 RL 任务格式一致,需要从更强模型中进行拒绝采样来获得合适轨迹。
我们提出 RGPO(Rationale‑Guided Policy Optimization),在模型当前能力范围内自适应利用真实理据信息,同时保留探索自由。RGPO 不把参考解视为固定的模仿目标,而是作为临时脚手架:理据帮助模型生成更好的响应,随后仅将获得更高奖励的模型生成解回传到原始无引导设置。该设计使得训练可以利用已有的理据,而无需离线数据遵循相同格式。
在纯文本和视觉‑语言推理两类任务上,RGPO 均显著超越 RLVR 基线。消融实验表明,自适应理据引导是性能提升的关键因素。实验结果表明,RGPO 能有效降低奖励稀疏,提升强化学习的稳定性,并在文本和多模态模型的推理表现上取得进步。
点评