NeFut Logo NeFut
EN 管理员登录

[AI学术] 科学搜索代理的失败:曝光与检查尝试的决策检查点审计

发布于:2026-10-01 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

在科学文献检索任务中,仅靠最终答案的准确率无法判断搜索代理是否成功遇到了目标论文、是否尝试了检查,或在检查后返回了接受的答案。为此我们提出决策检查点(decision checkpoints),在推理过程中记录观察和工具动作,而不需要基准标签;随后将目标身份和评估者标签合并,根据记录的事件为每个问题分配结果类别。实验在一个固定、目标丰富的环境中,对 540 道可回答的 AutoResearchBench 深度问题进行五种条件的比较。关键词搜索的准确率为 24.6%,而原始搜索为 17.8%。关键词条件下,错误答案中既未曝光也未检查目标的情况更少,但在目标已曝光但未检查的情况下错误增多。与关键词搜索相比,先阅读(read‑first)条件记录的证据搜索调用增加了 27.4%。在 read‑first 条件下有 199 道题尝试检查目标,关键词搜索下为 191 道,两者的准确率均为 24.6%。检查点协议使这些问题层面的差异透明化,能够将目标曝光、检查行为与整体准确率和工具使用量区分开来。

点评:检查点方法提供了细粒度的行为追踪,为评估搜索代理的真实能力提供了新视角。

原文链接: https://arxiv.org/abs/2609.38670

[h] 返回首页