在大规模语言模型(LLMs)中,链式思维(CoT)提示显著提升了推理能力,但常因过度推理而产生高昂的计算成本,导致冗余、冗长或无关的步骤生成。现有的推理步骤评估器有效地检测逻辑谬误和事实错误,但我们的分析揭示了一个关键盲点:它们未能惩罚有效但低效的推理步骤,这些步骤会增加 token 的使用而不对解决方案产生贡献。为系统性诊断这一限制,我们引入了 RIV-GSM8K,一个注入了五种不同低效类型的诊断基准,包括循环推理和过度分解。诊断实验表明,现有的最先进评估器在区分这些低效与必要推理时存在困难。为了解决这一差距,我们提出了 CAID(上下文感知信息密度),这是一种基于信息理论的无训练指标,用于识别低效用步骤。为了验证该指标的实际效用,我们将其应用于 PACE,一种后期压缩策略。额外的控制实验表明,PACE 的优势并非简单的修剪所致:与随机步骤移除和基于 PRM 的压缩基线相比,它在更高的压缩率下保持了准确性。在 GSM8K、StrategyQA 和 ARC-Challenge 上的实证结果表明,PACE 在保持准确性的同时减少了 31-53% 的 token 消耗,证实了 CAID 能有效提炼推理链中的信息泡沫而不妨碍演绎有效性。
博主点评: 本文深入探讨了链式思维在推理过程中的低效问题,提出了创新的 CAID 指标,能够有效识别并优化推理步骤,具有重要的实际应用价值。未来在大规模语言模型的推理效率提升上,CAID 或将成为一项关键工具。