推理分割的目标是解析隐含的文本查询并实现细粒度的视觉感知,这对人机交互和具身代理等场景至关重要。传统方法依赖多模态大语言模型(MLLM)先生成显式的思考链(CoT),再定位目标。虽然直观,但大量冗余的文本标记会干扰注意力分配,既削弱感知‑标记的生成,又拉大视觉标记之间的有效距离。
为消除这种干扰,我们提出 LIRSeg。它用一组可学习的潜在标记完全取代显式 CoT,实现紧凑的推理分割。LIRSeg 的训练分为两阶段:空间对齐阶段将潜在标记锚定到与目标对象相关的视觉证据上;GRPO 阶段在分割奖励的驱动下进一步优化这些标记。
为了让少量潜在标记承载更多信息,我们从信息论角度引入三种互补机制:极端优势采样用于挑选信息量最大的训练信号;解耦的探索‑稳定更新帮助学习互补的表征;潜在多样性放大防止表征塌陷。
在多个基准上的实验表明,LIRSeg 能显著提升分割精度并降低推理成本。相较于 VisionReasoner,LIRSeg 在 ReasonSeg、MUSE、MMR 三个数据集上分别提升 gIoU 4.9%、7.1% 和 4.7%,同时将推理标记数缩减约 16 倍。代码已随补充材料公开。
点评