NeFut Logo NeFut
EN 管理员登录

[AI学术] 颠覆性知识蒸馏:内化语言模型中的推理链

发布于:2026-07-28 22:00 最后更新:2026-07-29 01:08
#AI #Machine Learning #optimization

摘要

大型推理模型(LRMs)在生成最终答案之前,会产生长且明确的中间步骤链。这些中间过程虽然在答案正确性上并不直接相关,却在延迟、内存使用和服务成本上占据了主要部分。由此引出一个自然的问题:是否可以将这些中间令牌表达的计算内化到语言模型的参数中,使其能够直接生成答案(或仅用更短的中间过程)?

我们提出了知识蒸馏框架,称为masked distillation,在此框架中,学生语言模型(LLM)被训练为仅在问题条件下预测解决方案令牌,而推理教师在条件问题及其自身的推理链之后对学生的响应提供反馈。

该框架有两种实现方式:

  1. 自蒸馏设置,其中相同的模型在思考模式下作为教师,在非思考模式下作为学生;
  2. 双模型设置,其中一个更大的推理教师监督一个单独的小型非思考学生,专注于解决方案令牌。

通过将中间令牌视为推理模型适应解决方案令牌的支架,我们还可以调整学生所监督的中间令牌的长度,介于完全内化(学生仅发出解决方案)与无内化(学生在答案之前发出完整的推理链)之间。

我们在两个推理领域(GSM8K(小学算术)和Countdown(数字谜题搜索任务))通过控制实验评估了该框架。

博主点评: 此研究为语言模型提供了一个新颖的推理内化方法,显著降低了推理过程的资源消耗,展现了知识蒸馏在提升模型效率方面的巨大潜力。

原文链接: https://arxiv.org/abs/2607.22629

[h] 返回首页