NeFut Logo NeFut
EN 管理员登录

[AI学术] MetaRubric:基于评分标准的强化学习奖励学习

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#algorithm #AI #Machine Learning

Rubric‑based 强化学习通过为每个响应要求分配部分分数,将奖励驱动的优化扩展到开放式任务。然而,评分标准的评判者有时会在响应缺少必要信息或动作时仍给出高分,这种现象称为 Vacuous Credit。该问题会在去除关键信息后仍然存在,甚至会导致 GRPO 优势的符号翻转。

MetaRubric 通过交替进行证据感知的策略优化和基于响应的评分标准自适应来解决此问题。首先为每个提示构造一个反事实版本,即在原提示中替换一个任务相关事实。策略优化阶段,仅在响应中检测到足够证据满足对应 rubric 条件时才授予分数。随后,利用当前策略生成的响应对原始和反事实的评分标准进行修正,保持原提示在各自事实下的评分意义不变。每个阶段结束时,还会调整评分标准的权重,以更好地纠正观察到的策略错误。

在多个模型骨干上实验表明,MetaRubric 将 PubMedQA 的准确率提升了 6.00%~20.40%(相较于静态评判的 GRPO),在 HealthBench‑Hard 以及两个多模态医学基准上也取得了进一步提升。

点评

原文链接: https://arxiv.org/abs/2610.02824

[h] 返回首页