摘要
基于标准的强化学习通过对模型输出进行明确标准的评估,丰富了语言模型训练。然而在GRPO风格的流程中,这些结构化的评判被简化为标量响应级别的奖励,并统一转换为响应级别的优势,这导致在生成的响应中没有明确的信用分配机制,即使不同标准依赖于不同的范围、格式决策或语义选择。
我们提出了CoRT,一种针对标准条件的GRPO的令牌级信用加权方法。CoRT不使用辅助的令牌评分模型,而是通过反事实重放在原始的标准条件提示和匹配的无标准提示下重新评分相同的采样响应。结果的令牌级对数似然对比作为对标准上下文依赖性的代理。CoRT将这些对比映射到有界的、响应标准化的权重,并利用它们在不引入辅助评分器或改变响应级别奖励的情况下重新分配签名GRPO优势。
在指令调优模型和奖励粒度的实验中,CoRT在绝大多数比较中优于匹配的响应级别GRPO,平均提升4.4个百分点。该方法与学习的令牌级信用基线竞争力强,同时避免了单独的相关性学习阶段。这些结果表明,策略内部的反事实似然对比为响应内部的信用分配提供了有效的训练信号,同时保持了GRPO的简单性和稳定性。
博主点评: CoRT方法通过引入反事实重放机制,有效提升了基于标准的语言模型训练的精确度。这种方法不仅避免了引入复杂的辅助模型,还通过对比分析实现了对响应内部信用的合理分配,展现出强大的潜力和应用价值。值得关注的是其在实际应用中的稳定性与效率。