NeFut Logo NeFut
EN 管理员登录

[AI学术] GRPO 中隐藏的虚假优势

发布于:2026-09-04 22:00 最后更新:2026-09-05 12:23
#AI #Machine Learning #optimization

Group Relative Policy Optimization(GRPO)是一种在可验证奖励下常用的强化学习方法,其优势估计器会根据同组回报的统计信息为每条 rollout 分配一个幅度。常见情况下,这个幅度会奖励通过推理得到正确答案的 rollout。

然而在某些被忽视的情形中,rollout 可能仅凭猜测就得到答案,但公式仍会给出高幅度,这种现象我们称为虚假优势。出现虚假优势的三类任务是:

在上述情形下,策略会被误导,倾向于猜测而非推理。为了解决这一问题,我们提出了 SIGNBALANCE。其核心思想是:

在多个数学和搜索代理基准上进行的实验表明,SIGNBALANCE 在开放答案数学任务上与 GRPO 持平,在有界答案数学以及搜索代理任务上实现了显著提升。代码将在后续公开。

点评

原文链接: https://arxiv.org/abs/2609.04063

[h] 返回首页