准确分割息肉和皮肤病灶对临床诊断至关重要,现有方法常受低对比度、边界模糊和跨域分布差异的困扰。传统判别网络和多数基于扩散的分割模型仅输出二值掩码,未能利用大规模预训练生成模型的视觉先验。InstEditSeg 将医学分割重新定义为指令驱动的图像编辑任务。模型不直接生成掩码,而是在原始图像上渲染彩色叠加层,依据文本指令进行条件化,使编辑结果符合潜在扩散模型学习的自然图像分布,从而缩小自然图像与医学图像之间的域差距。为恢复细粒度解剖结构,引入 DINOv3 作为辅助视觉编码器,并设计 DINO 特征引导块构建多尺度特征金字塔。金字塔通过通道拼接和零初始化卷积融合进扩散 U‑Net,层次判别先验得以注入而不扰动预训练权重。采用双分支无分类器引导策略,每个去噪步骤仅需两次前向传播,显著降低推理成本。实验在息肉和皮肤病灶基准上实现与强判别基线相当的精度,并展示生成式框架的独特优势:对未见数据的跨域泛化更佳、多病灶分割更完整、可通过指令控制任务以及采样灵活性提升。进一步分析表明模型对颜色敏感且不支持属性条件选择。代码已公开。
点评