在语言推理模型(LRMs)领域,近年来随着训练和推理技术的进步,模型的推理能力在长度和准确性上都有了显著提升。
然而,越来越多的研究表明,LRMs 仍然存在低效问题,常常过度生成验证和反思步骤。为了解决这一挑战,我们提出了步骤标记(Step-Tagging)框架,这是一种轻量级的句子分类器,能够实时标注 LRM 生成的推理步骤类型。
为了监控推理行为,我们引入了 ReasonType:一种新的推理步骤分类法。基于这一框架,我们展示了在线监控特定步骤的数量可以为 LRM 推理提供有效且可解释的早停标准。
我们在三个开源推理模型上评估了步骤标记框架,涵盖标准基准数据集:MATH500、GSM8K、AIME,以及非数学任务(GPQA 和 MMLU-Pro)。我们实现了 20% 至 50% 的标记减少,同时保持与标准生成相当的准确率,尤其在计算负担较重的任务中取得了最大的收益。
这项工作为增强对 LRM 生成的控制提供了一种新颖的方法,并为研究 LRM 的行为提供了一种新工具。
博主点评: 步骤标记框架的提出,为语言推理模型的生成过程提供了有效的监控手段,具有重要的实际应用价值。通过减少冗余步骤,模型在计算效率和效果上均有提升,展现了未来研究的广阔前景。