在可验证奖励的强化学习(RLVR)中,通常使用熵进行优势塑造。然而,熵无法区分有用的不确定性与有害的混淆,限制了其作为正确性信号的有效性。我们提出了对比策略优化(CPO),它通过参考引导和普通生成分布之间的令牌级对比不一致来实现正确性感知的优势塑造。理论和实证结果表明,这种不一致可靠地指示了令牌级的正确性。
我们进一步展示了在线蒸馏是CPO的一个特例,其中后验分布由外部教师模型实例化。CPO还解决了零优势问题。在领域内和领域外的基准测试中进行的实验表明,CPO在性能上显著超越了基于熵的RLVR方法,同时保持强大的泛化能力。
进一步分析表明,正确和错误的响应自然分别支持探索和利用,平衡两者将导致最佳性能。
博主点评: 本文提出的对比策略优化(CPO)方法在强化学习中具有重要意义,通过引入对比不一致的概念,能够有效提高模型的正确性感知能力,展示了在复杂环境中更优的性能。这种方法为未来的研究提供了新的方向,值得关注。