在推理阶段使用大语言模型(LLM)进行搜索时,往往会在结构或语义相似的轨迹上反复探索,导致其他可能的解被忽视,这种现象我们称为 reasoning basin collapse。为了解决该问题,作者提出了 BASIN——一种无需额外训练、基于结构感知的选择方法。BASIN 将推理状态划分为不同的 basin,并对重复访问同一策略的路径施加惩罚,从而在固定计算预算下将搜索资源重新分配到真正不同的推理路径上。
实验在相同的推理预算下进行比较,BASIN 在 Game of 24 上相较于 Tree of Thoughts (ToT) 提升了最高 $+22$ 个百分点,在 MuSR 上提升了 $+6.7$ 个百分点。作者进一步提出了质量感知的变体 QA-BASIN,该变体在无条件多样化导致过度探索时,能够保留高质量的 basin,从而提升鲁棒性。
为了量化结构感知选择的有效性,论文引入了 redundancy gap $\Delta$,该指标衡量正确预测与错误预测在搜索集中程度上的差异。标准 ToT 的 $\Delta$ 往往接近 0,表明搜索未能区分好坏路径;而 BASIN 能持续将 $\Delta$ 推向正值,说明搜索更倾向于正确的路径。
总体而言,BASIN 展示了结构感知选择作为提升推理时推理质量的简洁且通用的手段。代码已开源于 https://github.com/GitHubLuCheng/basin。
点评