多链思考(parallel chain‑of‑thought)中出现的多样性崩塌促使研究者在推理阶段加入基于过程奖励模型(PRM)的干预。其自然思路是:当 PRM 剪枝掉一条链时,提取该链的高 PRM 前缀并原样 graft 到仍在解码的兄弟链中,形成所谓的 PRM‑剪枝片段嫁接(PPFG)。我们将 PPFG 视为跨轨迹步级转移的最小成本实现,并在此前的片段嫁接工作仅在加入额外补偿手段时才出现收益的操作点上进行测试。实验使用 Qwen2.5‑7B‑Instruct 配合 Math‑Shepherd,在完整的 MATH500 基准(n=500,三组随机种子)上比较两种 PPFG 变体(停滞目标和随机目标)与独立并行 CoT 基线的表现。结果显示,在所有测量维度上两者统计上不可区分。进一步分析 322 起停滞规则注入事件,依据四类划分,仅 14% 真正针对表现不佳的链,其余大多落在已经成功、接近完成或位于 PRM 平台的链上,这些状态下的 graft 无法产生救援效果。没有任何复合门控能够同时实现精准触发和足够密度,而随机控制在 2.4 倍触发率下仍保持同等效果,说明惰性并非特定启发式导致。该结论在三种基模型、六个基准、第二套 PRM 以及兼容性门控的全参数扫描中均得到复现;两侧单侧检验进一步将等价性提升为所有十二个 Qwen/LLaMA 单元的正等价。对单事件的抽样检查发现,注入链的剪枝速率是匹配步骤的 2.75 倍,但在存活的兄弟链上未观察到整体补偿。事后 Oracle 给出的每题最大增益上限为 +0.13 百分点。我们还提供了一套等价性检验模板,用于在特定操作点上确认推理时机制的空效应。
点评