大型语言模型(LLM)在多个领域展现出强大能力,医学领域亦被寄予厚望。但受限于缺乏能够捕捉临床推理和图文对齐的视觉问答(VQA)数据集,实际应用受阻。我们利用去标识化的医学影像和临床社交媒体上专家的评论,构建了一个由先进 LLM 与临床专家循环验证的严谨流水线,生成 ThoughtMed-1M 数据集,包含超过一百万条长文本 VQA 对,专注结构化临床逻辑和图文对齐。基于该数据集,我们训练了基础模型 FOLTMed(FOundational LLM Trained on ThoughtMed-1M),在 42 项医学 VQA 基准上实现宏观准确率 85.4%,并在 ThoughtMed-1M 测试集上生成更具临床连贯性的答案。相较于现有最优模型,FOLTMed 在事实性和相似度指标上提升 3%~5%,展示了可扩展的临床多模态 LLM 研究范式。
点评