NeFut Logo NeFut
EN 管理员登录

[AI学术] MiNER:针对疟疾临床文本的细粒度生物医学实体识别模型

发布于:2026-09-02 22:00 最后更新:2026-09-03 02:56
#AI #Machine Learning #LLM

疟疾仍是全球重要的公共卫生挑战,研究者需要从海量且持续增长的文献中快速获取分子机制、流行病学和潜在治疗信息。传统的手工检索难以满足规模和时效要求,因而迫切需要自动化的生物医学信息抽取技术。\ \ 本文提出一种基于 BioBERT 的细粒度实体识别框架 MiNER,用于从疟疾相关的科学文章中抽取临床重要实体。首先,构建并清洗一个包含数千篇疟疾论文的语料库,对文本进行分句、去噪和标准化处理。随后,依据医学指南人工标注实体类别(如疾病、药物、基因、症状等),形成高质量的监督数据集。\ \ 在模型层面,利用 BioBERT 将文本映射为上下文感知的向量表示,并在此基础上加入一个线性分类层进行序列标注。通过在标注数据上进行有监督微调,模型能够学习到疟疾领域的专有语义特征。\ \ 实验部分,分别比较了不同编码器(BioBERT、BioClinicalBERT、SciBERT)和传统机器学习方法(CRF、SVM)在精确率、召回率和 F1 分数上的表现。结果显示,MiNER 在所有指标上均显著优于基线,精确率提升约 7%,召回率提升约 9%。\ \ 为了促进社区复现与进一步研究,本文公开了完整的人为标注数据集以及训练脚本。该资源可直接用于训练更复杂的关系抽取或跨语言模型。\ \ 点评:该工作展示了在特定疾病领域通过微调 BioBERT 实现高效实体识别的可行性,为后续研究提供了宝贵资源。

原文链接: https://arxiv.org/abs/2609.00073

[h] 返回首页