NeFut Logo NeFut
EN 管理员登录

[AI学术] 通过自监督置信度训练提升推理效率

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #optimization

推理模型往往会生成冗长的推理轨迹,导致推理成本高昂。传统方法要么在推理时加入提前停止机制,要么在训练阶段通过强化学习等手段加入长度惩罚以鼓励更短的推理。本文提出一种不同的监督信号——置信度,并通过自监督方式对模型进行微调。具体做法是:在仅有 600 条训练题目的情况下,让模型在自身推理过程的中间节点预测答案的置信度,这一置信度仅作为训练目标,损失函数中不包含任何关于推理长度、效率或提前停止的项。推理阶段仍然使用标准的生成流程,不需要额外的置信度估计或提前停止机制。实验在 Gemma、Qwen、Nemotron 和 GPT-OSS 等模型上,分别在数学、科学和代码推理基准上进行评估。结果显示,经过置信度微调后,模型在保持相同准确率的前提下,生成的 token 数量最多可减少 $25\%$,效率提升可与显式优化推理长度的方法相媲美。进一步的分析表明,置信度监督主要保留了基模型的高层次推理结构,而不是简单抑制某些行为。我们的工作表明,学习元认知信号(如置信度)本身即可促成更高效的推理,而无需直接对效率进行优化。

点评

原文链接: https://arxiv.org/abs/2609.31619

[h] 返回首页