NeFut Logo NeFut
EN 管理员登录

[AI学术] 通过证据解耦分析医学视觉语言分割的文本分支敏感性

发布于:2026-09-11 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #Neural

预训练视觉语言模型在医学图像分割中通过临床文本提升性能,但文本对像素级预测的实际贡献尚不明确。

本文系统评估文本在多模态医学分割中的作用。首先比较了几种常用的特征融合方式,发现分割效果对融合模块的选择不敏感。

为进一步解析模态交互,提出基于证据深度学习和深度监督的证据解耦解码器(Evidence Decoupling Decoder,EDD)。EDD 在保持竞争性分割性能的同时,能够在解码过程逐层分离图像证据和文本调制证据,作为内部表征分析工具。

实验在四个公开数据集上进行。BUSI 与 BTMRI 上去除文本会导致分割性能骤降,说明模型高度依赖文本;而在 ISIC 与 Kvasir‑SEG 上文本影响有限。

进一步分析表明,文本主要通过全局语义调制而非独立的空间定位影响预测;驱动文本敏感性的具体语义成分在不同数据集间存在差异。

这些发现深化了对多模态医学图像分割中模态交互的理解,并为后续模型设计提供了实用参考。

点评: 本文提供了系统的实验框架和可解释的解码器,为评估和利用文本信息指明了方向。

原文链接: https://arxiv.org/abs/2609.02663

[h] 返回首页