NeFut Logo NeFut
EN 管理员登录

[AI学术] 在蒸馏前先验证:基于提示的教师门控用于在线蒸馏

发布于:2026-09-05 22:00 最后更新:2026-09-06 01:02
#AI #Machine Learning #LLM

在线蒸馏(OPD)通过在学生自身的 rollout 上使用冻结教师提供的密集 token 级监督,加速后训练。传统的 OPD 对所有提示统一施加监督,却没有检查教师在每个提示上的可靠性。由于逆 KL 是模式寻优的,若教师自信但错误,会产生强烈且误导的更新。分布式代理(如熵或教师‑学生似然一致性)只能衡量不确定性或一致性,无法直接验证答案是否正确。

我们提出教师门控在线蒸馏(TGOPD),核心思想是先在提示层面验证教师可靠性,再决定是否使用密集 OPD 监督。TGOPD 通过少量经验证器打分的教师探测样本估计可靠性;若通过,则该提示进入标准 OPD;否则转向基于验证器的 GRPO 进行梯度更新。

在 4B 与 35B 学生模型上,分别在数学、代码和指令跟随三个任务上进行单域和多域训练实验。TGOPD 在所有六个单域设置中均优于 Vanilla OPD,并在多域训练下的七个基准上取得更高的平均得分。

此外,TGOPD 利用原本闲置的教师算力进行可靠性估计,使异步 OPD 中教师侧的 GPU 利用率从 9.8% 提升至 78.9%(4B 单域实验),显著降低了计算浪费。

点评

原文链接: https://arxiv.org/abs/2609.02998

[h] 返回首页