Group‑based 强化学习已成为大语言模型后训练的主流范式,但在奖励稀疏的多轮代理任务中,它往往只能为中间动作提供粗粒度的信用分配。为了解决这一问题,GiGPO 等工作引入了步级优势(step‑level advantage),试图对每一步动作进行更细致的评估。然而,这类信号仍然依赖于单条轨迹的最终结果,导致失败轨迹中的所有动作往往被同等视为负面,即使其中包含有效的子行为也难以得到正向奖励。
本文提出了 Potential‑Guided Policy Optimization(PGPO),专为多轮代理任务设计。PGPO 首先在每个 rollout group 中统计锚点状态组的回报,计算经验状态潜在值(state potential)。随后,通过相邻状态潜在值的差异来估计动作优势,从而实现跨轨迹的信用传播。该机制在失败轨迹内部也能区分有效与无效动作,提供更细粒度的步级信用。
在 ALFWorld 与 WebShop 两个基准上,PGPO 相较于最新的 group‑based RL 方法展现出显著的整体性能提升。进一步的分析表明,PGPO 能在几乎不增加训练开销的前提下,生成更具信息量的失败侧信用信号。
点评