NeFut Logo NeFut
EN 管理员登录

[AI学术] 重新思考大语言模型的在策略蒸馏 II:单一训练示例

发布于:2026-09-05 22:00 最后更新:2026-09-06 01:02
#AI #Machine Learning #LLM

在策略蒸馏(OPD)通过学生自行生成的 rollout 与教师提供的密集 token 级监督相结合。以往研究主要关注算法行为,训练数据的作用尚不明确。本文在数据极限条件下,仅使用单个查询进行训练,探讨其效果。

实验表明,单查询 OPD 在数百步内持续提升,并在多个任务域和模型系列中恢复了全数据 OPD 大部分收益。我们通过 状态覆盖率(student 在训练中访问的状态占全数据 OPD 访问状态的比例)解释这一现象。单个查询的 rollout 已能覆盖约 $71.5\%$ 的状态,其中大部分在前 100 步内完成。

加入语义上不同的查询会提升覆盖率和验证准确率,16 条查询可达到 $98.9\%$ 的覆盖率,效果与全数据训练相当。然而,无论是单查询还是完整数据集,学生与教师的对齐速度都呈相似下降趋势,即使固定状态集合也需要数百步才能完全吸收。由此我们认为 OPD 存在 数据供给过剩、算法供给不足 的现象:rollout 能快速提供广泛监督,但学生对这些监督的吸收速度逐步放慢。

该结论同样适用于多教师 OPD(MOPD),每个领域使用 16 条语义多样的查询即可匹配全数据 MOPD 的表现。进一步的压力测试显示,内容轻量的模板查询以及域外的 WildChat 查询也能逼近真实查询基线,说明任务内容与诱导的状态覆盖可以相互独立。

点评:这些发现提示后续研究应聚焦于提升 OPD 的步数效率,重新审视数据规模与机制之间的关系,以更好地利用少量高质量查询实现大模型的高效蒸馏。

原文链接: https://arxiv.org/abs/2609.04172

[h] 返回首页