在大型语言模型的后训练过程中,评估者对政策引导样本的反馈是提升模型性能的关键机制。随着政策的改进,这些样本的响应质量趋于接近,形成了政策优化的瓶颈:相对评估者分数的缩减导致政策监督的效果薄弱或误导。
我们通过概率分配的视角理论性地阐明了这些差距的重要性,证明了从一个响应转移概率质量到另一个响应的方向性增益正是它们之间的评估者分数差距。这一发现将相对分数差距识别为指导政策更新的优化信号。
基于此视角,我们提出了DynamicRubric,这是一种响应集条件下的评估者-政策共演进框架,为每个候选集生成加权二元评分项,并将结果判断聚合为响应级分数。
在使用8B骨干网络的实验中,DynamicRubric的评估者性能得到了提升,并且提供了比使用70B奖励模型或235B静态评分生成器的基线更强的政策监督。经过DynamicRubric优化的政策在可验证推理和编码任务上也有显著提升。
DynamicRubric优化的模型已在微信搜索的AI问答场景中全面部署,处理每日数千万的在线请求,并改善了关键的在线指标。这些结果表明,评估者应与他们监督的政策共同演进,以实现评估者引导的后训练原则。
博主点评: DynamicRubric的提出为大型语言模型的优化提供了一个新思路,通过评估者与政策的动态共演进,解决了响应质量接近导致的优化瓶颈,具有重要的实践意义和应用潜力。其在微信搜索中的成功应用证明了这一方法的有效性,未来有望在更多场景中推广应用。