强化学习中使用可验证的奖励(RLVR)为训练多回合工具使用代理提供了一个验证者边界的性能上限。然而,其轨迹级别的信用分配将每回合的异构结果混淆为一个单一的奖励信号。在线策略蒸馏提供了密集的每标记监督,但要么受到教师的边界限制,要么容易出现梯度集中的崩溃。我们引入了 $ extbf{CrEST}$,一个分层的信用分配框架,该框架保留了强化学习的验证者边界,同时融入了来自特权自教师的密集标记级信号。 $ extbf{CrEST}$ 在两个级别解决信用分配问题:回合分段的验证优势解决了回合间的稀释问题,而熵门控自教师调制则细化了回合内的标记贡献。实验结果表明,$ extbf{CrEST}$ 一致地优于强化学习和蒸馏基线,尤其是在长轨迹和严格的会话级别指标上。我们的工作表明,教师在政策优化中的作用可以从确定更新方向转变为调节更新幅度,从而实现密集的信用分配而不牺牲验证者边界。 博主点评: 本文提出了一种新颖的信用分配框架 $ extbf{CrEST}$,它能够有效地解决多回合多步骤LLM代理中的信用分配问题。通过保留强化学习的验证者边界并融入自教师的密集标记级信号,$ extbf{CrEST}$ 在实验中展现了卓越的性能,尤其是在长轨迹和严格的会话级别指标上。这一成果为多回合多步骤LLM代理的训练提供了新的思路和方法,具有重要的研究意义和应用价值。