生物医学本体归一化将自由文本映射到标准概念,保证数据的一致集成与分析。由于词汇多样性以及层次相关概念之间的细微差别,概念边界往往难以辨认。为此我们提出 OntologyAligner,一个由三阶段组成的框架:
- 本体对齐检索:利用本体结构对检索空间进行约束,快速生成候选概念集合。
- 大语言模型(LLM)重排序:将候选集合输入 LLM,依据上下文语义对候选进行打分并重新排序。
- 层次引导的选择性细化:在概念层次上进行二次检查,仅对高置信度的候选执行层次约束校正。
我们构建了 PhenoNormBench,整合了七个 Human Phenotype Ontology(HPO)子数据集,共计 13,390 条样本,形成统一评测基准。实验表明 OntologyAligner 在 HPO 归一化上取得 88.78% Macro Top‑1 与 86.75% Micro Top‑1 的最新纪录,分别比最强基线提升 4.85 与 5.07 个百分点。消融实验显示三阶段相互补充,候选集规模和模型骨干的变化对性能影响有限。进一步将同一框架迁移至 MONDO、MEDIC 与 NCBITaxon,仍保持竞争优势,验证了方法的可移植性。
代码与基准数据已开源,地址:https://github.com/zhelishisongjie/OntologyAligner。
点评