NeFut Logo NeFut
EN 管理员登录

[AI学术] MedTVL:融合视觉与语言的医学时间序列分类模型

发布于:2026-09-02 22:00 最后更新:2026-09-03 02:56
#AI #Machine Learning #Neural

近期的多模态学习研究表明,将不同信息源融合能够提升医学时间序列(MedTS)分类的临床决策质量。大多数方法仅在时间序列与文本之间进行双模态交互,忽视了时间序列、视觉和语言三者的协同作用。受临床诊断同时依赖数值评估、影像检查和病史描述的启发,本文提出了 MedTVL——一种面向 MedTS 分类的文本引导双路径架构。\ \ 在 MedTVL 中,卷积网络构建的时间路径负责捕获原始数值序列的细粒度时序动态;基于 Transformer 的视觉路径则将时间序列转化为图像后提取整体形态结构。两条路径在跨模态和结构异构上形成互补,为诊断提供全局视角。为缓解潜在的诊断歧义,文本语义通过自适应机制同时调节两条路径的特征表达。随后,Mixture‑of‑Experts 机制根据每个样本的特性动态选择融合专家,从而捕获实例对时间路径和视觉路径的不同依赖程度。\ \ 此外,MedTVL 还支持多模态对比学习,以应对临床标签稀缺的问题。大量实验覆盖多个医学数据集和任务,包括监督学习、少样本学习以及对比学习场景,结果一致显示 MedTVL 在性能和迁移能力上均优于现有方法,具备成为稳健临床决策支持工具的潜力。\ \ 点评

原文链接: https://arxiv.org/abs/2608.28605

[h] 返回首页