NeFut Logo NeFut
EN 管理员登录

[AI学术] 回到定义:通过轨迹图估计步级优势的 Agentic 强化学习方法

发布于:2026-09-25 22:00 最后更新:2026-09-28 00:49
#AI #Machine Learning #Graph

在组式强化学习(如 GRPO 及其变体)中,利用组归一化优势估计能够在回复层面提供可靠的信号,但在步级别会出现系统性偏差,因为粗粒度的轨迹优势难以准确反映单步贡献——失败的轨迹仍可能包含有价值的步骤。

回到强化学习的基本定义可以发现,GRPO 在单轮任务上的成功源于其优势估计遵循了“同一状态下多次采样的动作的平均奖励即为可信的状态价值”这一原则。要在每个中间状态上采样多次动作以获得精确的步级优势代价过高。

为此我们提出了基于图的可信步级信用分配框架(GRAFT),将所有 rollout 轨迹拼接成轨迹图,通过在图上进行 Bellman 迭代恢复节点的状态价值,并用相邻节点价值差为每条边分配信用。理论上,得到的步级优势严格符合强化学习的基本优势定义。

为进一步降低状态价值估计偏差,我们在轨迹图上扩展了 GAE,形成 Graph GAE,从而抑制估计误差。实验在多轮 agentic 基准上对比 GRPO 以及最新的 agentic RL 方法,均表现出一致的提升并取得领先。代码将在 https://github.com/xcyao00/GRAFT 发布。

点评

原文链接: https://arxiv.org/abs/2609.28963

[h] 返回首页