大型推理模型(LRM)在复杂任务上表现出色,但常出现系统性低效:对简单问题思考过度,对困难问题思考不足。传统做法通过统一的长度惩罚或固定路由来削减计算,却会在易例上牺牲计算,在难例上导致准确率下降。我们将高效推理视为实例自适应计算分配问题,提出 When2Think——一种后训练框架,能够根据题目难度动态分配推理步数。核心机制为实例级难度感知控制(IDAC),它利用预先统计的参考指标(准确率和 token 使用量)对奖励进行形状化,从而调节推理深度。IDAC 与基于验证器的奖励以及批量标准化优势相结合,实现了无需评论者(critic)且不依赖学习奖励模型或在线参考模型查询的稳定优化。模型在易例上直接给出答案(相当于 System 1),在难例上延长推理(相当于 System 2),实现了 NoThink 与 Think 的自适应切换。实验在数学基准 AIME 上验证了该方法的优势:在 AIME24 上 Pass@3 提升 10.0%,token 使用量下降 27.9%;在 AIME25 上 Pass@3 达到 40.0%,显著超越压缩和仅路由的基线。
点评