NeFut Logo NeFut
EN 管理员登录

[AI学术] 共识驱动的无标签自蒸馏新方法:CANON

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:19
#algorithm #AI #Machine Learning

摘要

采样多个解决方案并返回多数答案是提高大型语言模型推理准确性的一种可靠方法,尤其是在没有标签的情况下。越来越多的方法将这一共识信号转化为训练监督。然而,现有方法仅将共识用作有限形式:作为选择解决方案进行微调的过滤器,作为答案之间的偏好,或作为强化学习的标量奖励,忽略了相互一致的解决方案所包含的大部分信息。

我们提出了CANON(Consensus-ANchored self-distillatiON),一种无标签训练方法,它将共识转化为密集的、基于标记的监督。对于每个无标签提示,CANON采样多个解决方案,提取多数答案,并使模型的冻结快照在达到该答案的解决方案上进行条件化;这一共识锚定的教师随后在其自身的输出中对模型进行逐个标记的监督。

在数学和科学推理基准上的实验表明,CANON将通过率(pass@1)提高最多12个百分点,超越了无标签强化学习6个百分点的表现,同时计算量仅为其七分之一,并接近于基于黄金解决方案条件化的教师。通过对汇总的无标签数据进行训练,它能够迁移到保留的基准,匹配使用黄金标签的训练方法。分析表明,性能提升不仅仅是分布锐化:训练后,模型在之前32次尝试中从未解决过的问题上也能给出解答,且其多数投票结果本身变得更加准确。

博主点评: CANON方法展示了如何有效利用共识信息来提升无标签学习的性能,具有很高的研究价值和应用潜力。尤其是在资源受限的情况下,采用这种新思路能够显著提高模型的推理能力,值得深入探索与实践。

原文链接: https://arxiv.org/abs/2607.13643

[h] 返回首页