NeFut Logo NeFut
EN 管理员登录

[AI学术] 数据驱动的决策:通过离线蒸馏实现适应性目标路由与能力权衡分析

发布于:2026-07-22 22:00 最后更新:2026-07-23 12:33
#AI #Machine Learning #optimization

在大规模语言模型的预训练中,离线蒸馏已成为核心,但训练数据、目标参数化与模型能力之间的相互作用尚未得到充分表征。我们通过将问题分解为两个方面进行研究:

  1. 目标与能力分析:探讨训练目标如何塑造令牌级别的监督和下游性能。
  2. 数据与目标分析:研究数据异质性如何影响目标路由。

我们首先证明了语言建模目标($L_{\mathrm{LM}}$)和知识蒸馏目标($L_{\mathrm{KD}}$)会产生系统性不同的能力特征,并将这种差异追溯到直接观察的令牌强化与教师支持的替代监督之间的梯度级张力。为了量化这种张力,我们引入了诊断指标——支持覆盖率、观察令牌概率质量和教师分布集中度,并通过控制实验表明,支持大小 $k$ 决定了覆盖与清晰度之间的权衡,而蒸馏温度则控制支持内的概率分配。

接下来,我们考察了适应性目标路由:一种域级策略对数学和代码应用 $L_{\mathrm{LM}}$,对一般领域数据应用 $L_{\mathrm{KD}}$,相较于单一目标基线在一致性上获得了显著提升,而基于观察令牌概率质量或教师熵的令牌级路由未能一致地匹配单一目标基线。这些结果表明,有效的目标路由更依赖于路由信号的质量,而非路由的细粒度,从而将通过离线蒸馏的继续预训练重新框定为一个结构化的数据条件监督设计问题,而非全局超参数选择问题。

博主点评: 本文深入探讨了离线蒸馏在大规模语言模型预训练中的重要性,提出了新的分析框架和诊断指标,为优化目标路由提供了理论基础。这种方法论不仅有助于理解模型能力的形成,也为未来的研究提供了新的方向,尤其是在数据异质性管理方面。

原文链接: https://arxiv.org/abs/2607.16246

[h] 返回首页