摘要
大型语言模型(LLMs)在复杂推理任务中通过思维链(CoT)提示取得了显著成功。然而,这些模型常常出现“计算过度思考”的现象,生成冗余的推理步骤,增加了延迟和成本,而没有提高准确性。近期研究表明,CoT 轨迹可以显著修剪,但现有方法通常依赖于强制静态思维预算、启发式过滤、亚最优的分类提前退出或昂贵的再训练。
在本文中,我们介绍了 OS-Pruner,这是一种轻量级的插件框架,将思维链的修剪形式化为一个最优停止问题。给定一个推理前缀,OS-Pruner 学习是否进一步推理值得其代价,通过优化一个明确的效用,权衡最终答案的准确性与生成长度。我们的新颖公式使模型能够动态评估推理链的终止充分点。
OS-Pruner 旨在在训练和推理过程中都保持轻量,并为用户提供关于推理努力与准确性权衡的细粒度控制。在多样的推理基准和基础模型上,OS-Pruner 实现了生成长度减少 20-60\%,并且几乎没有牺牲准确性。
博主点评: OS-Pruner 的提出为推理模型提供了一种高效的动态修剪方法,通过最优停止理论有效减少了冗余推理步骤,显著提高了推理效率。这一创新有望在未来的推理任务中发挥重要作用,尤其是在需要实时响应的应用场景中。