Ultrasound 是常用的医学成像方式,近期大型视觉语言模型在超声图像理解上取得进展,但缺乏像素级视觉证据与语义预测的对齐,细粒度定位能力尚不明确。
为此我们构建 UltraG-Bench,一个大规模多任务基准,覆盖 40 个公开超声分割数据集,涉及 13 个解剖类别。基准包括三层任务:指令引导分割、证据支撑的视觉问答、证据支撑的报告生成,分别拥有 331125、666779、138832 条标注。
对 14 个最新模型进行全面评估,发现语义理解与像素级定位之间存在显著差距。
我们进一步提出 UltraG-Agent,将 VLM 的语义推理能力与 UltraSAM3 的超声专用分割能力相结合。实验表明 UltraG-Agent 能显著提升语义预测和像素级定位。
数据集和代码已开源,链接:https://github.com/zhuqh19/UltraG-Bench。
点评