NeFut Logo NeFut
EN 管理员登录

[AI学术] SearchAuditor:审计和归因长视野搜索代理的失败

发布于:2026-08-07 22:00 最后更新:2026-08-08 01:08
#LLM #Open Source #SearchAuditor

SearchAuditor 是一个多角度审计框架,旨在有效地定位、归因和修复搜索代理的失败。搜索代理通过长视野的网络交互来解决复杂的问题,这个过程既复杂又容易出错:小的推理错误可能会通过长的、嘈杂的轨迹传播到流利但不正确的答案。诊断这些失败是困难的,需要手动检查非常长的执行轨迹,这可能超出了人类的能力。 因此,我们引入了 SearchAuditBench 基准,它评估 LLM 审计器是否可以定位、归因和修复这些失败,从而减少人工负担。SearchAuditBench 由 1,243 个失败的轨迹组成,平均每个轨迹有 73.1 个消息和 65.1K 个标记,收集自八个开源模型在五个深度搜索基准上的执行结果,每个轨迹都由专家注释了关键错误步骤、搜索特定的根因和参考修复,以及评分标准。 实验结果表明,即使是最强大的基线模型,当使用 GPT-5.5 等前沿模型时,也只能达到 26.6% 的端到端通过率。相比之下,我们的 SearchAuditor 在不同前沿模型上始终优于所有基线模型,达到 32.3% 的端到端通过率,并且使用其修复结果可以使代理更好地从错误中恢复。 博主点评: SearchAuditor 框架为解决搜索代理的失败问题提供了一个有效的解决方案,其多角度审计方法和修复能力使其在搜索代理领域具有广泛的应用前景。

原文链接: https://arxiv.org/abs/2608.05212

[h] 返回首页