NeFut Logo NeFut
EN 管理员登录

[AI学术] 基于遮蔽临床上下文的 SNOMED CT 概念推荐

发布于:2026-09-17 22:00 最后更新:2026-09-18 00:46
#algorithm #AI #Machine Learning

标准化临床语言到 SNOMED CT 能提升互操作性、分析和可复用表型,但当相关概念稀缺或训练数据中缺失时,概念推荐仍具挑战。我们基于 SNOMED CT Entity Linking Challenge v1.2.1,使用 MIMIC‑IV‑Note 构建了遮蔽概念推荐基准。数据包含 75,491 条标注,覆盖 272 份出院小结,其中 204 份用于训练,68 份用于历史测试。对每个唯一的笔记‑概念对,目标提及在局部临床上下文中被遮蔽,系统需在训练期间出现的 SNOMED CT 概念集合中排序。

我们比较了流行度基线、稀疏 TF‑IDF 概念原型、密集潜在语义分析(LSA)嵌入、稀疏‑密集融合、检索笔记证据以及检索增强混合模型。稀疏 TF‑IDF 表现最佳,Recall@1 为 14.81%,Recall@10 为 33.43%,MRR 为 0.2114,nDCG@10 为 0.2297。检索增强未提升基线,Recall@10 为 31.99%,MRR 为 0.1937。概念出现频率对性能影响显著:仅在 1‑2 份训练笔记中出现的概念 Recall@10 为 7.74%,而出现超过十次的概念 Recall@10 为 43.90%。此外,9.66% 的测试笔记‑概念对包含训练未见概念。结果表明,在资源受限环境下,局部词汇上下文和术语覆盖是推荐质量的关键因素,并为后续本体驱动和生物医学编码检索系统提供了可复现的基准。

点评

原文链接: https://arxiv.org/abs/2609.17855

[h] 返回首页