在组式强化学习(如 GRPO 及其变体)中,利用组归一化优势估计能够在回复层面提供可靠的信号,但在步级别会出现系统性偏差,因为粗粒度的轨迹优势难以准确反映单步贡献——失败的轨迹仍可能包含有价值的步骤。
回到强化学习的基本定义可以发现,GRPO 在单轮任务上的成功源于其优势估计遵循了“同一状态下多次采样的动作的平均奖励即为可信的状态价值”这一原则。要在每个中间状态上采样多次动作以获得精确的步级优势代价过高。
为此我们提出了基于图的可信步级信用分配框架(GRAFT),将所有 rollout 轨迹拼接成轨迹图,通过在图上进行 Bellman 迭代恢复节点的状态价值,并用相邻节点价值差为每条边分配信用。理论上,得到的步级优势严格符合强化学习的基本优势定义。
为进一步降低状态价值估计偏差,我们在轨迹图上扩展了 GAE,形成 Graph GAE,从而抑制估计误差。实验在多轮 agentic 基准上对比 GRPO 以及最新的 agentic RL 方法,均表现出一致的提升并取得领先。代码将在 https://github.com/xcyao00/GRAFT 发布。
点评