NeFut Logo NeFut
EN 管理员登录

[AI学术] E-Bench:真实产品场景中的多步骤工具使用代理基准测试

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#AI #Machine Learning #Open Source

摘要

大型语言模型(LLMs)越来越多地被用作与状态环境进行多步骤交互的代理:收集隐藏信息、组合工具调用和提交状态更改。我们称这种能力为多步骤工具使用。现有基准测试在工具使用代理评估方面有所进展,但往往关注于孤立的API调用、短轨迹或难以扩展或控制的设置。

我们引入E-Bench,这是一个完全合成的基准,涵盖三个产品领域的323个状态变化任务:王者荣耀、QQ音乐和腾讯会议。E-Bench将环境合成与任务合成解耦:图引导的数据库填充构建可重用的、无孤立的产品环境,而生成器-求解器不对称性则创建具有信息差和工具差的任务,要求代理发现隐藏数据并组合多个工具调用后才能更改状态。结果通过数据库状态差异确定。

由于环境和任务都是合成的,E-Bench在环境层面是可控的,在任务层面是可扩展的。对11个尖端LLM的基准测试显示,多步骤工具使用仍然具有挑战性:在最强模型中,Pass^3保持在60%以下,即使在E-Bench-Code扩展中进行代码执行,可靠性(Pass^3)仍然低于70%。

博主点评: E-Bench为多步骤工具使用提供了一个新的基准框架,解决了现有评估的局限性。通过合成环境和任务,研究人员能够控制和扩展测试条件,为未来的模型开发提供了宝贵的数据支持。尽管当前的性能仍显不足,但这一研究无疑推动了大型语言模型在复杂环境中的应用潜力。

原文链接: https://arxiv.org/abs/2607.23722

[h] 返回首页