NeFut Logo NeFut
EN 管理员登录

[AI学术] 面向临床社交媒体的视觉大语言模型用于医学图像识别

发布于:2026-09-11 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #LLM

大型语言模型(LLM)在多个领域展现出强大能力,医学领域亦被寄予厚望。但受限于缺乏能够捕捉临床推理和图文对齐的视觉问答(VQA)数据集,实际应用受阻。我们利用去标识化的医学影像和临床社交媒体上专家的评论,构建了一个由先进 LLM 与临床专家循环验证的严谨流水线,生成 ThoughtMed-1M 数据集,包含超过一百万条长文本 VQA 对,专注结构化临床逻辑和图文对齐。基于该数据集,我们训练了基础模型 FOLTMed(FOundational LLM Trained on ThoughtMed-1M),在 42 项医学 VQA 基准上实现宏观准确率 85.4%,并在 ThoughtMed-1M 测试集上生成更具临床连贯性的答案。相较于现有最优模型,FOLTMed 在事实性和相似度指标上提升 3%~5%,展示了可扩展的临床多模态 LLM 研究范式。

点评

原文链接: https://arxiv.org/abs/2609.06914

[h] 返回首页