Group Relative Policy Optimization(GRPO)是一种在可验证奖励下常用的强化学习方法,其优势估计器会根据同组回报的统计信息为每条 rollout 分配一个幅度。常见情况下,这个幅度会奖励通过推理得到正确答案的 rollout。
然而在某些被忽视的情形中,rollout 可能仅凭猜测就得到答案,但公式仍会给出高幅度,这种现象我们称为虚假优势。出现虚假优势的三类任务是:
- 候选答案集合很小的有界答案任务;
- 开放答案集合中包含有界子集的情形;
- 搜索代理的预算足以打开多条通向同一答案的路径。
在上述情形下,策略会被误导,倾向于猜测而非推理。为了解决这一问题,我们提出了 SIGNBALANCE。其核心思想是:
- 保持验证器的符号不变;
- 使用全局尺度而非组内统计;
- 通过对每类使用 stop‑gradient 的重新缩放实现零均值平衡。相应的幅度计算可以表示为 $$\hat{A}=\text{sgn}(v)\cdot\frac{g}{\|g\|}\,,$$ 其中 $v$ 为验证器输出,$g$ 为全局梯度向量。
在多个数学和搜索代理基准上进行的实验表明,SIGNBALANCE 在开放答案数学任务上与 GRPO 持平,在有界答案数学以及搜索代理任务上实现了显著提升。代码将在后续公开。
点评