NeFut Logo NeFut
EN 管理员登录

[AI学术] SVR-R1:自验证强化学习中的多模态推理新框架

发布于:2026-07-15 22:00 最后更新:2026-07-17 08:46
#AI #Machine Learning #Reinforcement Learning

我们介绍了自验证推理器(SVR-R1),这是一个多回合的强化学习框架,将模型自身的验证转化为多模态推理的学习信号。对于每个查询,模型使用相同的权重提出答案,并给出一个二元自我判决(是/否)。如果判决为“否”,则会进行第二次思考;如果为“是”或达到回合上限,则确定输出以计算基于结果的奖励。

SVR-R1使用GRPO实现,并采用异步多回合展开框架,无需外部监督或辅助评估者。我们在视觉-语言推理基准上评估SVR-R1,结果显示其在强标准GRPO基线之上大幅提高了准确性。训练动态表明对验证的依赖性逐渐降低——验证回合减少,但测试准确性提高——这表明随着策略内化自我修正,验证与生成之间的差距缩小,能够通过我们的框架选择最自信的答案。

SVR-R1架起了推理时自我精炼与强化学习训练在视觉语言模型(VLMs)之间的较少探索的交集,为启动多模态推理提供了一种简单而有效的方法。我们将开源 SVR-R1 以促进未来在VLMs领域的研究。

博主点评: SVR-R1通过自我验证机制有效提升了多模态推理的性能,展示了在无监督情况下强化学习的潜力。其训练动态的改变表明模型逐渐掌握了自我修正的能力,这为未来研究开辟了新的方向,值得关注。

原文链接: https://arxiv.org/abs/2607.10966

[h] 返回首页