在证据综合中,越来越多地使用大语言模型(LLM)进行文献筛选,但误删相关研究的风险仍然存在。本文在一次概念复杂的范围综述中,预先登记并比较了人工与 LLM 的标题‑摘要筛选工作流。
在一次保守的仅标题筛选后,剩余 1,131 条记录分别由一名审查负责人、四名受训助理(各自筛选不重叠子集)以及七次完整的 LLM 运行(使用不同模型和处理配置)进行筛选,其中一次为名义上相同的重复运行。我们评估了保留的工作量、对 316 条已验证合格记录的操作召回率、筛选一致性、运行间的一致性以及程序负担。由于仅对进入父审查并完成全文评估的记录进行合格性验证,召回率为操作性估计。
结果显示,没有任何工作流能够找回全部已验证合格记录。人工工作流和两次 GPT‑5.4 文件批处理运行保留了 42.2%‑45.0% 的记录,召回率在 82.3%‑82.9% 之间。Gemini 3.1 文件批处理实现了最高召回率 83.9%,但保留了 56.7% 的记录。一次性处理配置的召回率均低于对应的文件批处理配置。两次名义相同的 GPT‑5.4 文件批处理运行在 91.7% 的记录上达成一致,却在 94 条记录上出现分歧,其中包括 29 条仅在一次运行中被保留的已验证合格记录。
讨论指出,LLM 的筛选表现受工作流实现方式影响大于模型本身。处理配置、工作量、记录层面的差异以及人与 LLM 决策的融合,都是部署系统的关键属性。对于高召回率任务,LLM 更适合作为经验证、可审计且有人监督的工作流的一部分,而非完全自主排除。
博主点评:本研究提醒我们,在实际证据筛选中,单纯依赖模型并不能保证完整性。合理设计工作流、结合人工复核,才能在提升效率的同时维持高召回率。