强化学习与可验证奖励(RLVR)显著提升了大语言模型的数学推理能力。近期工作在 RLVR 回滚中加入搜索以增加轨迹多样性,但多样性并不保证搜索产生的回滚策略优于当前策略。为弥补这一缺口,本文提出 APIVIS——一种在训练阶段将有限预算 Gumbel 搜索适配到块级数学推理的框架。APIVIS 在每个回滚组内同时使用直接生成和搜索得到的答案,使搜索发现的改进能够提供信息丰富的相对奖励。进一步地,针对搜索改进的 token 采用选择性监督,避免在组奖励均匀时 GRPO 失效而导致学习信号缺失。理论上,精确的价值引导选择能够提升每个搜索状态的期望验证奖励,并且该保证可扩展到完整的回滚策略;在价值估计误差有界的情况下,还能得到近似保证。实验在多个主流数学推理基准以及不同模型规模上进行,结果显示 APIVIS 相较于竞争的基于搜索的方法取得了显著提升,验证了其有效性。
点评