摘要
多视角空间推理要求视觉-语言模型比较图像间的视觉证据、对齐物体对应关系,并推断长视觉上下文中的空间关系。在这种情况下,思维链推理往往会变得冗长而不更准确。强化学习与可验证奖励自然适用于此任务,但标准的 GRPO 奖励依赖于稀疏的结果级反馈,无法提供推理轨迹出错的信号,也无法控制推理长度。
我们提出了 LenGuard-GPC,这是一种密集奖励框架,旨在同时解决这两个问题。对于每个采样轨迹,它比较标准提示和引导提示下的逐 token 预测分布,并使用结果的 token 和 KL 散度作为密集奖励信号。由于这一 KL 惩罚会在 tokens 上累积,并且本身会奖励更短的响应而不考虑质量,我们引入了分阶段的长度奖励,以在不单纯鼓励简洁的情况下,将推理长度控制在一定范围内。
在六个多视角空间推理基准测试中,LenGuard-GPC 提高了准确性,同时减少了平均响应长度。
博主点评: LenGuard-GPC 通过引入密集奖励机制与长度控制,有效提升了空间推理的准确性与效率。这一方法可以为未来的视觉-语言结合模型提供新的思路,值得深入研究与应用。