NeFut Logo NeFut
EN 管理员登录

[AI学术] 从RLVR到RLSVR:任务转化引发开放式LLM自我验证奖励的新篇章

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#algorithm #AI #Machine Learning

摘要

强化学习与可验证奖励(RLVR)在推理导向的大型语言模型(LLMs)中推动了近期的进展,特别是在数学和编程等领域,因其能够进行大规模优化。然而,其适用性主要局限于这些领域,因为在这些领域中,正确性可以被确定性验证。相对而言,开放式任务通常依赖于人类偏好、奖励模型或基于LLM的评判,这引入了评估偏差、评判能力瓶颈以及额外的推理成本。

基于自监督学习的原则,该原则通过构建预设任务从数据本身导出监督,我们提出了自我可验证奖励的强化学习(RLSVR),这是一种基于任务转化的训练范式,旨在将RLVR扩展至开放式任务。RLSVR将开放式任务转化为可验证的代理环境,这些环境的内部规则和交互结果自动生成奖励信号。

我们使用SpyRL实例化RLSVR,这是一个多智能体自我对弈环境,灵感来源于“谁是间谍?”(Who Is the Spy?)。在此环境中,智能体接收不对称信息,完成相同的目标任务,并投票识别指定的间谍。由于间谍身份是预设的,因此投票结果提供了完全可验证的奖励,而成功识别与输出质量密切相关。

在文本摘要、创意写作和数学推理的实验中,SpyRL在不可验证任务上优于现有的自我改善方法,并在可验证的推理任务上持续取得进展。这些结果表明,任务转化能够将可扩展的RLVR自我改善扩展到固有可验证领域之外。模型和代码已发布在 GitHub

博主点评: RLSVR的提出为开放式任务的自我改进带来了新的视角,利用可验证的奖励机制解决了传统RLVR的局限性。这种方法在理论和实践上都有广泛的应用潜力,尤其是在需要评估偏好的复杂任务中,值得关注其未来发展。

原文链接: https://arxiv.org/abs/2607.23802

[h] 返回首页