NeFut Logo NeFut
EN 管理员登录

[AI学术] SKIP:自我知识引导的逐步偏好学习框架用于简洁推理

发布于:2026-09-16 22:00 最后更新:2026-09-18 00:46
#Machine Learning #optimization #LLM

Chain-of-Thought(CoT)推理虽能提升大语言模型(LLM)的解题能力,但往往导致过度思考,带来计算开销、推理延迟,甚至在规模较大的模型上出现性能下降。现有的简洁推理框架通过压缩输出长度来降低成本,却以显著牺牲准确率为代价。\ \ 本文提出 SKIP(Self-knowledge-guided step-wise Preference learning),其核心思路是:先进行轻量化微调,使模型的输出风格更倾向于在每一步给出明确答案;随后引入知识探测机制,在每个推理步骤强制模型输出当前步骤的答案,从而得到可验证的中间结果。依据这些中间结果的正确性,构造偏好数据,并利用 Direct Preference Optimization(DPO) 对模型进行再训练,使其在保持推理正确性的同时,学会在更少的步骤内完成推理。\ \ 实验在多个基准数据集上进行。结果显示,SKIP 在显著压缩推理步骤数的同时,几乎不产生精度损失,且在微调后避免了常见的性能退化。进一步的跨分布测试表明,SKIP 具备良好的泛化能力。我们还对框架中的关键超参数(如微调学习率、探测阈值、DPO 权重)进行了消融研究,验证了每个组件的贡献。\ \ 点评:SKIP 通过将模型的自我知识与偏好学习相结合,提供了一条在效率与准确性之间取得平衡的可行路径,为大模型的实际部署提供了有价值的参考。

原文链接: https://arxiv.org/abs/2609.17019

[h] 返回首页