累计的科学知识在先前发现帮助研究者选择新问题、设计实验并解释结果时推动探索。要在大规模上实现这种价值,需要获取连接研究问题、科学流程、结论和证据的推理链路。我们提出大型知识模型(LKM),它将文献转化为共享的、可计算的推理资源。LKM 将论文表示为基于来源的推理图,结合对同一对象的结构遍历和语义检索,并在不同论文之间对齐相关问题、主张和推理链。该表示形成了科学推理全景,包含三种相互关联的视图:组织研究问题和未解方向的问答全景、展示可复用科学流程的工作流全景,以及将结论与其支持、争议和条件相连的证据全景。统一的底层结构支持推理感知的科学搜索、基于证据的问答、比较证据分析和研究规划。研究者和智能体可以通过科学意图检索相关工作,利用可检查的论据合成答案,并依据已有工作流和未解决的证据制定研究计划。我们描述了一个语料规模的系统并评估了科学检索和知识密集型问答。固定回答模型的情况下,LKM 检索在 ChemBench、PubMedQA 和 SciBench 上分别提升准确率 9.30%、4.20% 和 14.69%。通过将知识获取与科学推理和行动相连接,LKM 为发现相关研究、复用科学知识以及在研究者、智能体和研究周期之间协调累积探索提供了共同基础。
点评