急诊科(ED)的决策依赖于患者既往史、生命体征、实验室检查和心电图(ECG)等多源信息。视觉‑语言模型(VLM)能够同时处理这些模态,但高预测性能并不一定意味着模型真正利用了患者的 ECG。我们将这种现象称为 ECG 幻影:表面上具备多模态能力,却未能依赖患者特定的 ECG 信息。
ECG 幻影分为两类:
- ECG 忽视——ECG 对预测几乎没有贡献;
- ECG 混淆——匹配的 ECG 能提升性能,但与不匹配的 ECG 差距不大。
为评估这两种行为,我们在保持临床文本和预测目标不变的前提下,比较了使用匹配 ECG、使用结果不一致的错配 ECG,以及不使用图像输入的三种预测。实验在四种 VLM 上的 MDS‑ED 数据集进行,预测任务包括 ICU 入院和临床恶化。结果显示,匹配 ECG 并未在两项任务上带来一致的性能提升。
随后,我们在保持 VLM 主干冻结的情况下,采用监督学习训练四个受限视觉提示(visual prompt),再通过条件直接偏好优化(conditional direct preference optimisation)进行微调。该策略使模型在 ICU 入院预测上达到 70.6% 的平衡准确率,在恶化预测上达到 67.5%,并将匹配‑错配性能差距分别扩大至约 16.5% 和 5.5%。
总体而言,本文首次系统识别了临床多模态预测中的 ECG 幻影,并提出视觉提示调优作为一种高效的缓解手段。
点评