NeFut Logo NeFut
EN 管理员登录

[AI学术] PGPO:面向多轮代理任务的潜在引导策略优化

发布于:2026-09-03 22:00 最后更新:2026-09-04 02:14
#AI #Machine Learning #LLM

Group‑based 强化学习已成为大语言模型后训练的主流范式,但在奖励稀疏的多轮代理任务中,它往往只能为中间动作提供粗粒度的信用分配。为了解决这一问题,GiGPO 等工作引入了步级优势(step‑level advantage),试图对每一步动作进行更细致的评估。然而,这类信号仍然依赖于单条轨迹的最终结果,导致失败轨迹中的所有动作往往被同等视为负面,即使其中包含有效的子行为也难以得到正向奖励。

本文提出了 Potential‑Guided Policy Optimization(PGPO),专为多轮代理任务设计。PGPO 首先在每个 rollout group 中统计锚点状态组的回报,计算经验状态潜在值(state potential)。随后,通过相邻状态潜在值的差异来估计动作优势,从而实现跨轨迹的信用传播。该机制在失败轨迹内部也能区分有效与无效动作,提供更细粒度的步级信用。

在 ALFWorld 与 WebShop 两个基准上,PGPO 相较于最新的 group‑based RL 方法展现出显著的整体性能提升。进一步的分析表明,PGPO 能在几乎不增加训练开销的前提下,生成更具信息量的失败侧信用信号。

点评

原文链接: https://arxiv.org/abs/2609.02236

[h] 返回首页