EvoThink 是一个旨在解决大型推理模型(LRMs)过度思考问题的框架。LRMs 通常由于冗余的验证步骤而遭受过度思考,现有的缓解方法(如快慢思维切换和推理轨迹压缩)未能细致区分推理过程中的有益与冗余步骤,反而可能在追求效率的过程中损害推理能力。
EvoThink 的核心在于两个关键组件:
- 自我修剪训练(SPT):一种无监督方法,通过迭代修剪冗余推理步骤并在简化轨迹上进行自我训练,从而提高推理效率。
- 顿悟偏好优化(AMPO):受到遗传算法启发,识别有价值的失败推理尝试,合成从错误到正确的顿悟数据,并优化模型以内化这种推理模式。
在数学推理和代码生成基准测试中的广泛评估表明,EvoThink 不仅显著减少了推理时的 token 使用量,还提高了 LRMs 的推理能力。
博主点评: EvoThink 提出的自我修剪与顿悟优化机制为大型推理模型的高效推理提供了新的思路,尤其在处理复杂问题时,能够有效减少冗余步骤,提高模型的整体推理能力,具有重要的实用价值和研究意义。