NeFut Logo NeFut
EN 管理员登录

[AI学术] 在策略蒸馏中何为关键?数据效率与样本选择的视角

发布于:2026-09-08 22:00 最后更新:2026-09-09 09:08
#Machine Learning #LLM #Artificial Intelligence

On-Policy Distillation(OPD)已成为提升大语言模型推理能力的常用后训练手段,但其数据层面的机制仍未被系统研究。本文首先在极端条件下进行实验:仅使用单条示例进行训练,即 1‑shot OPD。结果出人意料:在所有抽样的训练示例中,1‑shot OPD 都能稳定提升性能,且难度更大的示例往往带来更大的增益。

进一步分析学生模型提升的根源时,我们发现并非高 token 熵驱动,而是更长的思考链(CoT)路径起关键作用。困难问题自然生成更长的 CoT,这有助于学生在更长的推理时间线上保持与教师的对齐,并学习到短 CoT 中缺失的关键思维模式,如反思(例如使用 “Alternatively”)。

基于上述发现,我们提出一种极简的数据选择策略:仅挑选困难示例进行训练,甚至可以使用完全超出教师能力的“不可解”示例。实验在四个模型(规模 1.5B‑7B)上验证,使用仅 8 条精选困难示例的训练效果即可匹配 17K 示例基线的表现。

点评:本文通过极端 1‑shot 实验揭示了长 CoT 对 OPD 效果的核心作用,并提出了只需极少硬例即可实现数据高效利用的实用方案,为后续大模型蒸馏提供了明确的方向。

原文链接: https://arxiv.org/abs/2609.05198

[h] 返回首页