NeFut Logo NeFut
EN 管理员登录

[AI学术] 搜索之后的难点:Web 代理在知识合成、组织与展示上的基准评测

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #LLM

现有的计算机使用代理基准大多只评估检索能力,未能覆盖代理作为助理时需要完成的完整工作流。一个有用的助理必须在复杂的多步骤流程中获取信息、将其合成为文档、演示或电子表格等产物,并能够在程序界面上进行交互,以生成连贯的最终结果。这类工作流要求推理与合成、任务分解以及视觉空间理解。

为研究代理在此类工作流中的表现,我们推出了 KNOWS 基准。KNOWS 包含一系列开放式、复杂的基于浏览器的任务,每个任务都以生成具体产物为结束点。任务的设计遵循一套任务设计评分表和确保任务满足要求的协议。每个任务配备一个评估程序,该程序将确定性检查与大语言模型(LLM)判断相结合,以在评估的丰富性、可靠性和自动化之间取得平衡。

我们对前沿的计算机使用代理和基于浏览器的工具链进行了评测与分析。结果显示,代理在部分成功指标上取得了中等分数,但在所有复杂、长时程任务中,最高的完整成功率不足 3%。即使代理完成了超过 50% 的其他评估步骤,视觉步骤的失误仍会导致产物不可用。

这些发现揭示了当前代理在端到端助理角色上的局限,强调了在工具使用、视觉理解和长时程推理方面的进一步突破需求。

点评

原文链接: https://arxiv.org/abs/2609.30604

[h] 返回首页