NeFut Logo NeFut
EN 管理员登录

[AI学术] 突破性强化学习:用辅助分支实现弱到强的转变

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#algorithm #optimization #Reinforcement Learning

摘要

强化学习(RL)结合可验证奖励已成为提升大型语言模型推理能力的标准方法,通常通过对比多个自生成的回放(rollout)来优化策略。然而,我们发现这一范式存在一个关键的支持限制瓶颈:在具有挑战性的推理任务中,目标模型的样本往往表现出语义冗余,聚集在同一错误的“推理盆地”中,提供的奖励对比对于策略更新几乎没有帮助。

为了解决这一局限性,本文提出了一种从弱到强的学习范式,其中策略的探索由一个较弱但计算效率高的辅助模型来引导。我们引入了 W2SPO,一种离线策略强化学习方法,它将短的辅助片段(通常仅为 8 个 token)插入到目标模型的中间轨迹中,目标模型随后从这些偏离的状态完成推理路径。策略更新仅限于这些基于最终可验证奖励的短插入片段。

实证结果表明,W2SPO 在数学推理基准测试中在评估的 4B 规模模型中表现优越,超越了经过后期训练的基线模型。与相同采样预算下的传统 GRPO 相比,W2SPO 将 Pass@1 从 62.3% 提高到 64.2%,同时实现了 3.55 倍的训练加速。这些结果表明,弱辅助分支可以通过扩展局部探索支持,诱导更强的目标推理策略。

博主点评: 这一研究通过引入弱辅助模型,显著提升了强化学习的推理能力,尤其在处理复杂任务时表现出色。利用短的辅助片段进行策略更新,不仅提高了训练效率,还增强了模型的推理能力,这为未来的研究提供了新的思路与方向。

原文链接: https://arxiv.org/abs/2607.16205

[h] 返回首页