NeFut Logo NeFut
EN 管理员登录

[AI学术] 全新基准测试:AppWorld-UL 评估多样化的代理-用户交互

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #Open Source

摘要

工具使用代理需要处理日常数字任务,例如订购杂货,不仅要操作应用程序,还要与用户进行交互,例如询问澄清问题、提示确认以及在指令不可行时告知用户。然而,当前评估代理-用户交互的基准并未捕捉到这种交互的多样性。此外,它们在小环境中运行,通常只有少量不改变状态的 API。为了解决这一问题,我们引入了 AppWorld-UL,这是一个包含 516 个具有挑战性的任务的“用户在环”基准,要求多样化的代理-用户交互。

基于 AppWorld 框架,我们使用了 9 个流行的模拟应用程序,如亚马逊和 Spotify,系统性地修改原始任务,以引入模糊性和限制,促使各种类型的代理-用户交互。用户行为由一个大型语言模型(LLM)模拟,该模型根据精心设计的知识边界进行响应,提供比以往工作中使用的无约束或过于严格的替代方案更可靠的模拟。

我们的评估显示,最先进的 LLM Claude Opus 4.7 在 AppWorld-UL 上的成功率仅为 48.6%,在更难的组合子集上仅为 35.7%。在更严格的场景级指标下,组合任务的表现降至仅 21.3%。我们的分析表明,正确的用户交互对于成功至关重要。这证明了基准的难度及其在推进用户在环工具使用代理研究方面的潜力。

博主点评: AppWorld-UL 为评估代理-用户交互提供了重要的标准,揭示了当前 LLM 在复杂人机交互中的局限性。这不仅推动了工具使用代理的研究,也为未来的改进提供了宝贵的方向。通过引入模糊性和限制,研究者能够更好地理解和优化代理的表现。

原文链接: https://arxiv.org/abs/2607.20536

[h] 返回首页