本文提出 Looped Self-Distillation(循环自蒸馏)框架,模型在固定信息预算下反复生成代码并直接学习自身的原始输出,无需外部评估或基于测试的样本筛选。实验发现,正确率可以提升的同时,正确实现的多样性会收缩。为此我们设计了 SPECTRUM 方法:在每一轮以固定参考锚点重新估计对损失敏感的键值几何,并将其转化为满秩的近端谱调制。所有生成的完成度统一用于训练单一学生模型,随后推理无需额外干预。实验在 MBPP 数据集上进行五轮迭代,SPECTRUM 保留了初始模型 64 条正确抽象语法树(AST)丰富度的 89.9%,而普通自蒸馏仅为 66.4%,子空间投影对照为 65.5%。在等量正确样本的比较中优势仍然显著。无需进一步训练或重新校准,得到的学生模型在 HumanEval+ 与 APPS Intro 上的匹配正确丰富度也高于普通自蒸馏,表明多样性收益能够迁移。该工作将正确解的保持视为递归自改进的补充目标,并展示生成时干预能够提升后续学生保留的解集规模。
点评