紧凑的指令跟随重排序模型在实际部署中非常受欢迎,但传统的蒸馏流程通常在固定样本上离线模仿教师的输出,这限制了监督只能覆盖教师已观察到的排序空间。我们从强化学习的视角重新审视重排序蒸馏,提出一个两阶段框架,将离线教师优化与在线学生蒸馏相结合。
第一阶段,使用离线 GRPO 方法在 88K 指令跟随示例上引入 LLM‑judge 反馈,强化一个 4B 教师重排序模型。
第二阶段,紧凑的 1B 学生模型自行采样排序,并依据教师提供的软奖励对这些排序进行学习,实现学生探索与知识转移的耦合。
在分布迁移条件下效果最为显著。对 MAIR‑11(原始 11 子集,869 条查询)评估,学生模型达到 0.7670 的 nDCG@6,较离线列表式 KD 提升 4.6 分。与离线成对 RankNet KD 和在线 GKD 的对照实验表明,仅改变离线蒸馏目标或在学生采样的分布上进行教师匹配均无法复现基于奖励的在线蒸馏优势。该优势在 MAIR‑Full(126 项任务,9,356 条查询)上同样保持,学生模型在任务宏观指标上最高,nDCG@6 为 0.6808,MRR@6 为 0.7865。相比两款已发布的 7B RL 训练重排序模型,本文方法在相同的 MAIR‑11 评估上也取得更好成绩。相同的第二阶段训练流程还能一致提升三种结构不同的学生骨干网络。
在 9,861 条查询的验证基准上,得到的 1B 重排序模型实现 0.7624 的 nDCG@6,并在质量‑效率权衡上优于更大的模型。
点评