NeFut Logo NeFut
EN 管理员登录

[AI学术] RISE:通过自我外推策略蒸馏实现递归改进

发布于:2026-09-08 22:00 最后更新:2026-09-09 09:08
#AI #Machine Learning #LLM

在语言模型后训练中,基于策略的蒸馏(OPD)能够为每个 token 提供密集监督,但其效果受限于教师模型的质量。外部教师往往出现分布不匹配,而使用特权条件进行自蒸馏又受限于模型的上下文学习能力。

RISE(Recursive Improvement via Self‑Extrapolating Policy Distillation)通过直接利用模型自身的 RLVR 训练轨迹构造合成教师。具体做法是,在参数空间或输出 logits 空间中,对当前检查点与一个滞后锚点之间的位移进行外推,从而把稀疏的结果驱动的参数更新转化为密集的 token 级目标,无需外部模型或特权条件。

RISE 将 RLVR 与 OPD 组合成互补循环:结果奖励为外推提供正确推理的方向,外推得到的教师则细化每个 token 的决策。由于教师在每次迭代中随学生的提升而刷新,蒸馏过程成为递归改进机制,而不是一次性的压缩步骤。

在数学推理、多领域 STEM、代码生成以及多轮交互任务等实验中,RISE 均显著超越仅使用 RLVR 的训练以及基于策略的自蒸馏方法。

点评:RISE 通过自我生成的教师实现了密集监督与结果驱动的双向强化,展示了递归改进在大模型微调中的潜力。

原文链接: https://arxiv.org/abs/2609.05295

[h] 返回首页