NeFut Logo NeFut
EN 管理员登录

[AI学术] UltraG-Bench:用于评估大型视觉语言模型在超声像素级证据定位上的多任务基准

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #Open Source

Ultrasound 是常用的医学成像方式,近期大型视觉语言模型在超声图像理解上取得进展,但缺乏像素级视觉证据与语义预测的对齐,细粒度定位能力尚不明确。

为此我们构建 UltraG-Bench,一个大规模多任务基准,覆盖 40 个公开超声分割数据集,涉及 13 个解剖类别。基准包括三层任务:指令引导分割、证据支撑的视觉问答、证据支撑的报告生成,分别拥有 331125、666779、138832 条标注。

对 14 个最新模型进行全面评估,发现语义理解与像素级定位之间存在显著差距。

我们进一步提出 UltraG-Agent,将 VLM 的语义推理能力与 UltraSAM3 的超声专用分割能力相结合。实验表明 UltraG-Agent 能显著提升语义预测和像素级定位。

数据集和代码已开源,链接:https://github.com/zhuqh19/UltraG-Bench。

点评

原文链接: https://arxiv.org/abs/2609.30928

[h] 返回首页