系统综述需要在人类判断上投入大量时间,往往要审阅上千条记录。现有的大语言模型(LLM)评估大多只关注评审流程的单一环节,缺乏全流程视角。为此我们推出 SciLitBench,一个覆盖标题/摘要筛选、全文筛选以及基于模式的数据抽取的多阶段基准。数据集包含 42,981 条检索记录、1,012 篇全文以及 888 篇入选论文的标注。
在 22 种开源权重模型(六个模型族)上实验发现,显式的纳入/排除标准能够将标题与摘要筛选的 $F_2$ 提升 28.8%,而研究者提供的筛选理由则使全文筛选的准确率提升 15%。数据抽取表现呈现不同的可靠性区间:出版年份的准确率高达 0.97,而计算方法的 Jaccard 重叠仅为 0.37;最强模型只能恢复 30% 的评估证据和 25% 的局限性。
SciLitBench 揭示了高召回筛选与证据完整抽取之间的实际边界,并提供了可复现的资源,用于评估 LLM 辅助的证据合成过程。
点评