NeFut Logo NeFut
EN 管理员登录

[AI学术] 思考还是不思考:在有益处的地方分配推理长度

发布于:2026-09-26 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #LLM

强化学习(RL)已被证实能够提升大语言模型(LLM)在复杂数学和编程任务上的推理能力。然而,这种提升伴随着系统性的 长度误配:模型在简单问题上耗费过多推理步骤,而在更难的问题上提前终止,导致推理效率下降且准确率提升有限。许多长度自适应方法通过根据问题难度分配 token 预算来缓解此问题,隐含假设更难的问题会从更长的推理中单调受益。我们发现,推理长度对准确率的影响主要集中在 部分可解 的问题上。进一步分析表明,显式的长度奖励会引发意料之外的训练动态。基于这些观察,我们提出 CARE(Contrastive Accuracy Reward Estimation),该方法在在线采样的响应中比较每个问题的有益长度调整,并在 Group Relative Policy Optimization 中施加自适应长度奖励,无需额外超参数或推理开销。实验在多个推理基准上显示,CARE 能将 Pass@1 提升至多 $4\%$,同时将推理长度缩短 $37\%$,实现更高的 token 效率。代码将在论文接受后公开。

点评:CARE 通过对比式奖励估计实现了对推理长度的细粒度调控,既提升了模型的解题成功率,又显著降低了计算成本,展示了在实际推理场景中兼顾效率与效果的可行路径。

原文链接: https://arxiv.org/abs/2609.29664

[h] 返回首页