NeFut Logo NeFut
EN 管理员登录

[AI学术] 用引导式多模态大语言模型提升可解释心脏诊断

发布于:2026-07-25 22:00 最后更新:2026-07-26 07:44
#algorithm #AI #Machine Learning

摘要

心电图(ECG)是心脏评估的基石,但深度学习模型的临床部署受到有限可解释性和大型语言模型(LLMs)幻觉风险的制约。现有的 CNN+Grad-CAM+多模态 LLM 框架能够生成 ECG 报告,但其解释往往与既定诊断标准的关联较弱,降低了可信度和可重复性。

我们提出了一种引导式多模态框架,明确将报告生成锚定在经过策划的临床知识上。首先,卷积神经网络(CNN)和 Grad-CAM 从 12 导心电图图像中生成类别概率和类别特定热图。同时,权威的 ECG 教科书和指南材料被离线提炼为结构化的 ECG 解释指南,作为固定知识块注入到每个样本中。

在 ECG 图像、Grad-CAM 重叠图、CNN 导出的事实包和注入的指南的条件下,多模态 LLM 生成结构化的诊断报告,使用与指南一致的术语和标准。对完整的 PTB-XL 测试集进行的实验表明,引导锚定提高了生成报告的语义质量和感知一致性,同时保持了竞争性的分类性能。特别是,我们的方法将生成印象的平均 BERTScore 从 0.818 提高到 0.953,相较于强大的 CNN+Grad-CAM+MLLM 基线,表明与参考报告的对齐更加紧密。这些发现表明,将提炼的解释指南注入多模态提示管道,为减少幻觉并增强基于 LLM 的 ECG 解释的临床合理性提供了一条实用路径,使可解释的心脏诊断更接近于实际部署。

博主点评: 本文提出了一种创新的引导式多模态框架,通过结合 CNN、Grad-CAM 和 LLM,有效提升了心电图报告的可解释性和一致性,展示了深度学习在医疗领域的潜力。该方法不仅提高了报告的质量,也为临床应用提供了新的思路,具有重要的实践意义。

原文链接: https://arxiv.org/abs/2607.20814

[h] 返回首页