大规模推理模型(LRM)在给出答案前会生成长链式思考序列,导致推理开销显著。剪枝可以削减计算量,但其效果高度依赖用于估计参数重要性的校准数据。已有工作使用模型自身的生成轨迹进行校准,却对所有推理 token 采用统一处理,未区分其是否对正确推理有贡献。于是剪枝倾向于保留统计显著的权重,而非真正推动正确推理的权重,导致错误计算路径同样被保留,削弱了模型的推理质量,表现为准确率下降且思考链更长。为此我们提出 OBC‑Prune。OBC 首先在模型对同一道题给出不一致答案时,构造难度匹配的正确与错误 rollout 对,然后通过干预分析评估每个推理句子的因果重要性,即移除该句子后对后续预测的影响程度。将得到的因果重要性转化为每个 token 的权重,用以重新缩放一刀切剪枝方法(如 SparseGPT、Wanda、ALPS)中的校准激活,而不改变原有剪枝算法。实验在 DeepSeek‑R1‑Distill‑Qwen 1.5B、7B、14B 模型上,以 40% 与 50% 稀疏度进行评估,分别在 MATH500、LiveCodeBench、AIME 2025 数据集上与最新校准基线比较,几乎在所有模型规模和稀疏度下均取得一致提升。结果表明,保留因果上重要的推理回路远优于仅保留观测激活的统一目标。
点评