在强化学习(RL)领域,训练大型语言模型(LLM)代理已成为关键方法。然而,流行的策略如GRPO/RLOO依赖于多条独立采样的完整轨迹进行优势估计。在长时间跨度的代理任务中,这种均匀的展开策略可能会浪费预算在无效的死胡同尝试上,而有前景的中间状态却得不到足够的探索。
代理轨迹的多回合结构,交替进行的动作和观察,自然支持将轨迹组组织为树形结构,每个回合作为探索的决策点。这一视角将有效探索重新定义为决定从何处分支的问题。我们提出了过程评分引导的自适应树展开(PATR),这是一个针对多回合代理强化学习的质量感知展开框架。PATR利用任务适应的过程反馈来评分部分轨迹,选择性地从有前景的状态分支,重用共享前缀,并保守地停止退化路径以减少无效采样。
最终生成的展开组与标准策略优化兼容,同时在相同训练预算下提供了更高效的探索。我们在FrozenLake和具有挑战性的SWE-Bench上评估PATR,后者在之前的树展开代理RL方法中尚未得到充分探索。实验结果表明,PATR在SWE-Bench上提高了性能,最高提升5.0分,在FrozenLake上提升9.3分,突显了过程引导的树展开作为可扩展多回合RL的有效策略。
博主点评: PATR通过引入过程反馈和质量评分机制,显著提升了多回合RL的探索效率,展示了强化学习在复杂任务中的新潜力。这一方法不仅优化了资源的使用,还为未来的研究开辟了新的视角,值得关注。