NeFut Logo NeFut
EN 管理员登录

[AI学术] EcoAgent-Bench:评估预算约束LLM代理的经济决策能力

发布于:2026-08-07 22:00 最后更新:2026-08-08 01:08
#LLM #Artificial Intelligence #Economic Decision-Making

Agent 基准测试通常测量任务完成度,并将资源利用率视为辅助统计指标。然而,在实际部署中,选择本地查找、广泛搜索、复合研究工具、更强大的模型或人工升级是任务本身的一部分。我们引入了 EcoAgent-Bench 基准测试,其中每个任务都指定了带有价格的动作和明确的预算。它包含 304 个真实任务,涵盖五个来自 GAIA、HotpotQA 和 MuSiQue 的任务家族,测试四种决策:避免不必要的升级、当本地证据不足时升级、选择模型层级和在不支持的前提下停止。我们评估了七个 LLM 代理在工具 API 和工作空间 CLI 设置中,以及四个脚本化的 oracle 控制。微平均准确率奖励单方面的政策:始终升级的控制实现了高的微观成功率,但未能完成节省导向的任务。因此,我们还报告了经济一致性得分(升级导向和节省导向任务家族组的准确率较差),这暴露了这种失败。工具 API 代理仅获得 3.9-24.0% 的微严格成功率(最多 7.3% 的经济一致性),通常要么在升级之前停止,要么在廉价任务上过度支出。阈值交叉预算扫描改变了 GPT-5.4 的升级率从 0% 到仅 3%。这些结果表明,在预算下完成任务和选择经济行动是不同的属性。我们发布了任务包、转换管道、冻结评估环境和绑定完整性结果工件,用于研究这两种属性。 博主点评: EcoAgent-Bench 基准测试为评估预算约束 LLM 代理的经济决策能力提供了一个全新的视角,凸显了任务完成度和资源利用率之间的平衡。同时,这也对开发更具经济效益的 LLM 代理提出新的挑战,需要在任务完成度、资源利用率和经济一致性之间找到最佳平衡。

原文链接: https://arxiv.org/abs/2608.05519

[h] 返回首页