NeFut Logo NeFut
EN 管理员登录

[AI学术] ECG幻影:揭示并缓解临床预测中视觉语言模型对心电图的利用不足

发布于:2026-09-21 22:00 最后更新:2026-09-22 02:29
#AI #Machine Learning #Neural

急诊科(ED)的决策依赖于患者既往史、生命体征、实验室检查和心电图(ECG)等多源信息。视觉‑语言模型(VLM)能够同时处理这些模态,但高预测性能并不一定意味着模型真正利用了患者的 ECG。我们将这种现象称为 ECG 幻影:表面上具备多模态能力,却未能依赖患者特定的 ECG 信息。

ECG 幻影分为两类:

  1. ECG 忽视——ECG 对预测几乎没有贡献;
  2. ECG 混淆——匹配的 ECG 能提升性能,但与不匹配的 ECG 差距不大。

为评估这两种行为,我们在保持临床文本和预测目标不变的前提下,比较了使用匹配 ECG、使用结果不一致的错配 ECG,以及不使用图像输入的三种预测。实验在四种 VLM 上的 MDS‑ED 数据集进行,预测任务包括 ICU 入院和临床恶化。结果显示,匹配 ECG 并未在两项任务上带来一致的性能提升。

随后,我们在保持 VLM 主干冻结的情况下,采用监督学习训练四个受限视觉提示(visual prompt),再通过条件直接偏好优化(conditional direct preference optimisation)进行微调。该策略使模型在 ICU 入院预测上达到 70.6% 的平衡准确率,在恶化预测上达到 67.5%,并将匹配‑错配性能差距分别扩大至约 16.5% 和 5.5%。

总体而言,本文首次系统识别了临床多模态预测中的 ECG 幻影,并提出视觉提示调优作为一种高效的缓解手段。

点评

原文链接: https://arxiv.org/abs/2609.21755

[h] 返回首页