大型语言模型通过后训练展现出日益强大的推理能力。传统后训练方法在大量 token 上进行优化,隐含假设有效学习必须是 token 密集的。我们在 on‑policy distillation(OPD)框架下重新审视该假设,该框架天然支持在每个生成 token 上提供教师的密集监督。以 Qwen3 系列为例,我们意外发现,仅在推理轨迹中标记极少数 token——每条轨迹 1 到 2 个,约占全部 token 的 0.05%——即可显著提升推理能力。稀疏监督在多数情况下与全 token 训练持平或更优,尽管绝大多数生成 token 被排除在训练目标之外。该现象在九组不同规模的教师‑学生配置上均得到复现,覆盖数学推理、代码推理、Llama 系列以及基于 PPO 的可验证奖励强化学习(RLVR)等任务。我们认为,这种极度稀疏的监督更接近人类的学习方式:不对每一步逐字纠正,而是针对少数关键步骤进行反思、更新认知后继续尝试,从而避免微观层面的干预却仍然高效。总体而言,结果动摇了后训练必须是 token 密集的传统观念,为设计更高效的后训练算法指明了新方向。点评