NeFut Logo NeFut
EN 管理员登录

[AI学术] 对抗性黑盒在线策略蒸馏的持久负样本

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#algorithm #Machine Learning #LLM

黑盒在线策略蒸馏(OPD)在教师只能提供抽样响应而无法给出 token 概率的情况下,尝试让学生模型通过自身生成的数据提升性能。对抗性蒸馏通过学习一个判别器来区分教师与学生在相同提示下的响应,并将判别得分作为策略奖励。传统做法在每一步都从最新的学生生成负样本,这导致奖励函数随策略更新而不断变化,形成移动目标问题。

为了解决该问题,本文提出持久负样本对抗性蒸馏(persistent-negative adversarial distillation),采用 live‑pool 方法在每个判别器批次中用一定比例的历史教师‑学生匹配对替代最新负样本。这样在保持判别器计算量不变的前提下,历史对用于训练判别器,而 GRPO 仍然使用最新学生响应保持在线策略更新。

理论分析表明,贝叶斯最优奖励等价于教师与负样本的对数密度比。在显式假设下,持久负样本能够固定判别器的负分布,从而相较于仅使用新负样本显著降低奖励估计的均方误差(MSE)。

实验在两类学生模型、三位评审以及四个 judged‑chat 基准上进行。结果显示,在相同判别器计算预算下,持久负样本对抗性蒸馏始终优于现有方法,并且判别器的策略轨迹更平滑,出现低于随机水平的跌落更少。这表明负样本分布是黑盒在线蒸馏设计中的关键维度。

点评

原文链接: https://arxiv.org/abs/2609.30864

[h] 返回首页