摘要
在蒸馏大型语言模型(LLMs)推理能力的标准方法中,通常会从模型中采样思维链,保留那些能够达到正确最终答案的链条,并对这些存活下来的链进行微调。当采样失败时,一种常见的修复方法是向生成器展示真实答案,并要求其写出一个能达到该答案的思维链。我们发现,这第二步会以一种正确性过滤无法捕捉到的方式削弱训练数据。
我们进行了一个控制实验,固定生成器、问题集和正确性过滤器,仅改变链条是否在答案条件下生成,即展示黄金答案并请求生成一个达到该答案的链。结果显示,基于自身答案条件链训练的强指令调优推理模型,其可验证推理准确性显著下降。在最困难的竞赛问题上,损失高达约27个百分点。
这一机制在链条中是可察觉的,链条从展示的答案逆向推理,而不是从根本上推导出答案,早期的最终答案陈述成为可测量的症状。这种损害是数据的属性,而非生成器的问题,且在任何微调之前的未标记生成中可以观察到,跨越四个家族的八个思维模型的惩罚也呈现出转移特性。通过提示消融实验,我们将问题局限于朝向理性推理的指令,而非答案的可见性。
实用结论:生成无答案条件的思维链,因为没有任何正确性过滤器能识别数据中的这种损害。
博主点评: 这项研究揭示了在推理模型的训练中,答案条件化的思维链可能导致可验证推理能力的显著下降,提示我们在设计模型训练方法时需谨慎处理数据质量与生成策略的关系。尤其是在面对复杂问题时,盲目依赖答案条件化可能会适得其反。