在语言模型后训练中,基于策略的蒸馏(OPD)能够为每个 token 提供密集监督,但其效果受限于教师模型的质量。外部教师往往出现分布不匹配,而使用特权条件进行自蒸馏又受限于模型的上下文学习能力。
RISE(Recursive Improvement via Self‑Extrapolating Policy Distillation)通过直接利用模型自身的 RLVR 训练轨迹构造合成教师。具体做法是,在参数空间或输出 logits 空间中,对当前检查点与一个滞后锚点之间的位移进行外推,从而把稀疏的结果驱动的参数更新转化为密集的 token 级目标,无需外部模型或特权条件。
RISE 将 RLVR 与 OPD 组合成互补循环:结果奖励为外推提供正确推理的方向,外推得到的教师则细化每个 token 的决策。由于教师在每次迭代中随学生的提升而刷新,蒸馏过程成为递归改进机制,而不是一次性的压缩步骤。
在数学推理、多领域 STEM、代码生成以及多轮交互任务等实验中,RISE 均显著超越仅使用 RLVR 的训练以及基于策略的自蒸馏方法。
点评:RISE 通过自我生成的教师实现了密集监督与结果驱动的双向强化,展示了递归改进在大模型微调中的潜力。