摘要
Agentic LLM 系统如 OpenScholar 和 PaperQA2 能够读取科学文献并返回引用答案。目前,这些系统及其基准测试已经检查了这些引用的有效性,但并未审计检查本身的可靠性。我们展示了这种检查并不可靠,且这一点至关重要。在相同的代理输出中,未支持引用的测量率依赖于验证者的严格程度,范围从约 3% 到 18%。尽管验证者在哪些引用是支持的上达成一致,但在标记哪些引用时却存在分歧(负特异性一致性为 0.27 到 0.30),因此没有单一的标记集是值得信赖的,跨论文比较在没有指定验证者和协议的情况下是无效的。
我们提出了一种黄金锚定的评估协议和可部署的防护机制,使得这种行为可测量和可界定。该协议验证验证者,测量重新归属,并根据人类标准而非其他模型的判决进行校准;验证者是可以根据成本选择的可替换工具(在支持类上的召回率为 0.94)。重新归属是一个商品化步骤,其中确定性的 BM25 匹配最佳的开放生成器。防护机制增加了一个分裂保形层,为真正未支持的引用设定了一个分布无关的有限样本界限,这些引用可能会漏过所选的标记规则,提供的是捕获率的保证而非结论正确性的保证。该界限适用于持有的黄金样本,我们识别并量化了其转移到部署中的条件,校准负难度,并提供了一个具体的重新校准方案,这是之前保形事实工作未测试过的。
在四个开放的 27-35B 模型和三个代理管道上进行验证,使用公共基准(SciFact, QASA, PubMedQA),并对每个主要数字提供置信区间,该协议和防护机制作为一个开放的单 GPU 套件发布。
博主点评: 本文提出的评估与防护机制为科学文献引用的真实性提供了新的视角,尤其在当前信息泛滥的背景下,确保引用的可靠性至关重要。这种方法不仅提高了引用检查的透明度,也为后续研究提供了可行的标准化框架。