预训练视觉语言模型在医学图像分割中通过临床文本提升性能,但文本对像素级预测的实际贡献尚不明确。
本文系统评估文本在多模态医学分割中的作用。首先比较了几种常用的特征融合方式,发现分割效果对融合模块的选择不敏感。
为进一步解析模态交互,提出基于证据深度学习和深度监督的证据解耦解码器(Evidence Decoupling Decoder,EDD)。EDD 在保持竞争性分割性能的同时,能够在解码过程逐层分离图像证据和文本调制证据,作为内部表征分析工具。
实验在四个公开数据集上进行。BUSI 与 BTMRI 上去除文本会导致分割性能骤降,说明模型高度依赖文本;而在 ISIC 与 Kvasir‑SEG 上文本影响有限。
进一步分析表明,文本主要通过全局语义调制而非独立的空间定位影响预测;驱动文本敏感性的具体语义成分在不同数据集间存在差异。
这些发现深化了对多模态医学图像分割中模态交互的理解,并为后续模型设计提供了实用参考。
点评: 本文提供了系统的实验框架和可解释的解码器,为评估和利用文本信息指明了方向。