摘要
数据无关的知识蒸馏在没有原始训练数据的情况下,将教师模型中编码的知识转移到学生模型。先前的研究如对比归纳知识提取(CAKE)通过合成接近教师决策边界的样本,成功地实现了这一点。本文探讨这一边界追寻原则是否能扩展到自编码器蒸馏,实验基于 MNIST 数据集。
为了进行直接比较,我们将连续重构重新表述为一个密集的、逐特征的分类任务,使解码器能够输出分类对数。我们证明,在瓶颈生成架构中,边界追寻目标从根本上是错误设定的。CAKE 操作于单一实例级目标,但解码器作为一组紧密耦合的、受共享低维瓶颈约束的特征级分类器。独立地为这些耦合输出采样对比目标违反了学习的潜在流形的几何结构,导致严重的梯度冲突,而不是生成有信息的边界样本。流形感知合成完全绕过了这些冲突,并为无数据生成蒸馏建立了有效基准。
博主点评: 本文揭示了边界追寻方法在瓶颈生成模型中的局限性,强调了流形感知合成的重要性,为未来的无数据生成蒸馏研究提供了新的思路。如何有效解决梯度冲突,将是继续探索的关键。