材料研发正向依赖跨尺度的预测模型和全局仿真,但关键数据常散落在文献的非结构化文本中,导致可复用性差。传统的 LLM 提取方法多生成简单的键值对,难以满足本体约束。为此我们提出 eolas——一个模块化流水线,利用大语言模型将科学文献自动转化为符合指定本体的知识图谱。eolas 能在数分钟内完成全文解析,并以表格形式呈现带有多面导航的图谱,便于人工核验。我们以研究耐高温高辐射的聚变堆材料为案例,展示了该系统在提取材料成分、结构、实验条件和性能指标等多维信息方面的效果。相比人工专家需 30–90 分钟的手工提取,eolas 的效率提升显著。为评估 LLM 在本体对齐 KG 构建中的能力,我们构建了首个公开基准数据集,涵盖 168 项实验,提供文档、本体和参考图谱。基于该数据集,我们对多种 LLM、提示工程和后处理策略进行了系统实验,归纳出三条实用指南:① 明确定义本体并在提示中显式引用;② 采用分段抽取‑合并策略降低上下文负荷;③ 使用结构化验证脚本过滤不一致条目。该工作展示了大语言模型在材料科学知识图谱构建中的可行性与局限,为后续自动化文献挖掘提供了参考。
点评