NeFut Logo NeFut
EN 管理员登录

[AI学术] 问题的赌注:首步检索决定深度搜索代理的表现

发布于:2026-09-15 22:00 最后更新:2026-09-16 00:22
#AI #Machine Learning #LLM

深度研究代理通过搜索、阅读、推理的循环来回答复杂问题。近期在 BrowseComp-Plus 等推理密集基准上的实验表明,精心配置的词汇检索能够发现高质量证据,但代理仍可能无法将这些证据文档与金标准文档关联起来。我们发现,代理的首次检索动作是影响整体表现的关键设计点。\ \ Question's Gambit 是一种首步检索模块。它首先将问题拆解为若干线索,然后将这些线索重新表述为互补的检索查询。检索得到的结果会被合并、去重并重新排序,形成一个用于后续循环的初始上下文。该上下文既有助于线索的聚合,也便于最终答案的验证。\ \ 我们在 BrowseComp-Plus 上进行实验,结果显示 Question's Gambit 能提升检索召回率,并在下游代理的准确率上超越强基线。使用 gpt-5.5 时,答案准确率从 83.1% 提升至 90.5%,超过了目前报告的最强代理基线 Pi-Serini。进一步在 MultiHop-RAG 上的评估表明,这一提升同样适用于传统的多跳问答结构。\ \ 实验表明,深度研究代理的成功不仅依赖于循环内部的工具,还取决于首步检索的质量。我们的实现已在 https://github.com/radinhamidi/Question-s-Gambit 开源。\ \ 点评

原文链接: https://arxiv.org/abs/2609.14412

[h] 返回首页