NeFut Logo NeFut
EN 管理员登录

[AI学术] LenGuard-GPC:空间推理强化学习的新突破

发布于:2026-07-22 22:00 最后更新:2026-07-23 12:33
#Reinforcement Learning #Spatial Reasoning #Vision-Language

摘要

多视角空间推理要求视觉-语言模型比较图像间的视觉证据、对齐物体对应关系,并推断长视觉上下文中的空间关系。在这种情况下,思维链推理往往会变得冗长而不更准确。强化学习与可验证奖励自然适用于此任务,但标准的 GRPO 奖励依赖于稀疏的结果级反馈,无法提供推理轨迹出错的信号,也无法控制推理长度。

我们提出了 LenGuard-GPC,这是一种密集奖励框架,旨在同时解决这两个问题。对于每个采样轨迹,它比较标准提示和引导提示下的逐 token 预测分布,并使用结果的 token 和 KL 散度作为密集奖励信号。由于这一 KL 惩罚会在 tokens 上累积,并且本身会奖励更短的响应而不考虑质量,我们引入了分阶段的长度奖励,以在不单纯鼓励简洁的情况下,将推理长度控制在一定范围内。

在六个多视角空间推理基准测试中,LenGuard-GPC 提高了准确性,同时减少了平均响应长度。

博主点评: LenGuard-GPC 通过引入密集奖励机制与长度控制,有效提升了空间推理的准确性与效率。这一方法可以为未来的视觉-语言结合模型提供新的思路,值得深入研究与应用。

原文链接: https://arxiv.org/abs/2607.17243

[h] 返回首页