在推理时间扩展方面,DeepLook提出了一种监控与干预解码框架,旨在集中计算资源于不确定性瓶颈。该方法通过聚合token级别的置信度形成段级信号,当置信度相较于近期历史下降时触发,并使用固定视野的前瞻性探索候选续写。分支通过平均前瞻置信度(Average Lookahead Confidence, ALC)进行排名,随后进行修剪和汇总投票。
在四个竞赛风格的数学基准测试中,包括DeepSeek-R1-8B、Qwen3-32B、GPT-OSS-20B和GPT-OSS-120B,DeepLook在准确性与token成本之间的权衡上实现了显著改善。具体来说,在16种设置中,DeepLook在11种情况下提高了准确性,同时在数据集级别上平均减少了87.3%的token生成,包括在AIME25中使用Qwen3-32B提升了+3.1,在BRUMO25中使用GPT-OSS-20B提升了+8.8。这表明,选择性且具有未来意识的干预在准确性和成本之间提供了更强的权衡,而非均匀扩展完整的推理轨迹。
代码可在此处获取。