在交互代理的应用中,小型语言模型因其高效性而受到青睐。然而,直接从强大的教师轨迹进行蒸馏,往往将丰富的多轮行为转化为一次性模仿目标,导致在长时间环境中效率低下,因为早期的决策会影响后续状态和奖励。
为了解决这一问题,我们提出了 Prefix-GRPO,这是一种强化学习框架,它将教师轨迹分解为重放对齐的前缀查询和在线续集。每个前缀在环境中重放,以恢复有效的中间状态,随后学生将继续在线交互并获得任务奖励。与仅响应的 GRPO 不同,Prefix-GRPO 还对重放前缀中的历史助手令牌应用了剪辑策略更新,使用策略蒸馏的 SFT 检查点来估计其旧的对数概率。这将前缀学习和续集学习统一在同一策略优化形式中。
在 TextCraft、BabyAI 和 ALFWorld 上的实验表明,Prefix-GRPO 优于蒸馏和标准 RL 基线,而消融实验则显示,仅重放不足以支持显式的前缀令牌优化。实现与重现脚本可在 GitHub 上获取。
博主点评: Prefix-GRPO 的提出显著提升了小型模型在复杂任务中的表现,通过有效利用教师轨迹,优化了策略更新过程。这种方法在多轮交互中展现了巨大的潜力,值得进一步研究与应用。