NeFut Logo NeFut
EN 管理员登录

[AI学术] OntologyAligner:面向生物医学本体归一化的本体对齐检索与层次引导大语言模型重排序

发布于:2026-09-11 22:00 最后更新:2026-09-12 06:35
#algorithm #AI #Machine Learning

生物医学本体归一化将自由文本映射到标准概念,保证数据的一致集成与分析。由于词汇多样性以及层次相关概念之间的细微差别,概念边界往往难以辨认。为此我们提出 OntologyAligner,一个由三阶段组成的框架:

  1. 本体对齐检索:利用本体结构对检索空间进行约束,快速生成候选概念集合。
  2. 大语言模型(LLM)重排序:将候选集合输入 LLM,依据上下文语义对候选进行打分并重新排序。
  3. 层次引导的选择性细化:在概念层次上进行二次检查,仅对高置信度的候选执行层次约束校正。

我们构建了 PhenoNormBench,整合了七个 Human Phenotype Ontology(HPO)子数据集,共计 13,390 条样本,形成统一评测基准。实验表明 OntologyAligner 在 HPO 归一化上取得 88.78% Macro Top‑1 与 86.75% Micro Top‑1 的最新纪录,分别比最强基线提升 4.85 与 5.07 个百分点。消融实验显示三阶段相互补充,候选集规模和模型骨干的变化对性能影响有限。进一步将同一框架迁移至 MONDO、MEDIC 与 NCBITaxon,仍保持竞争优势,验证了方法的可移植性。

代码与基准数据已开源,地址:https://github.com/zhelishisongjie/OntologyAligner

点评

原文链接: https://arxiv.org/abs/2609.10055

[h] 返回首页