NeFut Logo NeFut
EN 管理员登录

[AI学术] SciLitBench:面向大语言模型的系统文献综述基准与设计原则

发布于:2026-09-10 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #LLM

系统综述需要在人类判断上投入大量时间,往往要审阅上千条记录。现有的大语言模型(LLM)评估大多只关注评审流程的单一环节,缺乏全流程视角。为此我们推出 SciLitBench,一个覆盖标题/摘要筛选、全文筛选以及基于模式的数据抽取的多阶段基准。数据集包含 42,981 条检索记录、1,012 篇全文以及 888 篇入选论文的标注。

在 22 种开源权重模型(六个模型族)上实验发现,显式的纳入/排除标准能够将标题与摘要筛选的 $F_2$ 提升 28.8%,而研究者提供的筛选理由则使全文筛选的准确率提升 15%。数据抽取表现呈现不同的可靠性区间:出版年份的准确率高达 0.97,而计算方法的 Jaccard 重叠仅为 0.37;最强模型只能恢复 30% 的评估证据和 25% 的局限性。

SciLitBench 揭示了高召回筛选与证据完整抽取之间的实际边界,并提供了可复现的资源,用于评估 LLM 辅助的证据合成过程。

点评

原文链接: https://arxiv.org/abs/2609.05505

[h] 返回首页