Guideline‑consistent 语义分割不仅需要识别类别,还要遵循细粒度的标注政策。近期的多代理细化系统通过检测并纠正错误来提升对文本指南的遵从,但它们是无状态的:批评代理的反馈在一次迭代后被丢弃,导致相同的指南特定错误在整个数据集上反复被发现并纠正,增加了额外的细化成本。
我们提出 InsightSeg,一种基于情景记忆的机制,将成功的纠正过程转化为可复用的、视觉锚定的洞察。一个元分析器会对每个符合条件的纠正回合进行提炼,生成指令式自然语言洞察,并使用 patch‑level 视觉概念向量将其锚定到导致错误的局部图像区域。
在后续图像处理中,这些概念会与密集的 patch 嵌入进行匹配,检索出相关洞察,并在分割代理进行首次预测前对其进行条件化。这样系统从“纠正重复错误”转向“预防错误”,在任何细化之前就提升分割质量。
在 Waymo 和 Cityscapes 数据集上的实验表明,InsightSeg 在首轮预测和最终的指南一致分割指标上均有提升,同时所需的细化步骤更少,验证了通过利用过去的纠正经验,多代理细化可以变得更准确且更高效。
点评