在可验证奖励的强化学习中,显式的链式思维(Chain-of-Thought,CoT)推理已成为在测试时间扩展的主要方法。然而,这一扩展路径的计算成本依然高昂,因为每个中间步骤都必须解码为语言标记。
相反,潜在推理通过连续向量承载中间计算,且在更短的时间范围内已达到或超过显式CoT的效果。尽管潜在推理具有这样的潜力,但其仍然在很大程度上受限于模仿,而显式CoT已通过结果奖励强化学习(RL)超越了模仿。
潜在轨迹缺乏可处理的逐步似然性和在固定思维预算下的自适应停止接口,因此结果奖励无法引导潜在测试时间的扩展。
我们提出了代理潜在策略优化(Surrogate Latent Policy Optimization,SLPO),旨在将结果奖励RL引入自回归潜在推理:通过潜在过渡的经验代理策略密度实现轨迹级别的信用分配,并引入一个正确性监督的停止头,使得结果奖励优化能够转化为可变时间范围策略。
在连续与软思维设置下,SLPO在并行采样下提高了 Pass@$k$ 绩效,并为更难的实例分配了更长的潜在计算,从而提升了确定性准确性。
博主点评: SLPO的提出为潜在推理提供了新的视角和方法,特别是在计算效率和准确性之间的平衡上,展现了潜在推理的广泛应用潜力。通过有效的代理策略,SLPO不仅解决了现有潜在推理的不足,还为未来的研究指明了方向。其在提高复杂实例处理能力方面的潜力尤为值得关注。