摘要
近年来,大型语言模型(LLMs)和视觉语言模型(VLMs)的进展使得将文本与图像结合用于报告生成变得更加简单。现有的医疗VLM通常专注于2D图像(如胸部X光),而将其扩展到3D成像的困难在于缺乏配对的3D成像-文本数据。因此,我们提出了一种针对脑肿瘤的3D图像-文本数据集创建新方法,使用了胶质瘤和脑膜瘤病例的3D MRI扫描。
我们采用一个合作系统,多个LLM协同工作以生成和检查报告,确保其准确性和清晰度。通过利用新的3D MRI-文本数据集,我们进一步构建了一个VLM,将MRI扫描转换为tokens,并将其与文本指令对齐。我们的VLM在报告生成和视觉问答任务中的表现优于其他2D和3D方法。
该方法不仅提高了报告的质量,还有助于脑肿瘤的更好诊断和治疗。
博主点评: 本文展示了如何利用新数据集和多模型协作来提升医疗报告生成的质量,突破了传统2D图像分析的局限,为脑肿瘤的诊断与治疗提供了更有效的工具。未来,类似的方法有望在更多医学影像领域得到应用。