NeFut Logo NeFut
EN 管理员登录

[AI学术] DAREBench:面向部署的可靠模型代理评估

发布于:2026-09-10 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #LLM

随着大语言模型从问答系统转向通用代理,评估必须超越静态答案的正确性,覆盖多模态感知、多步执行、工具使用和产出交付。现有基准往往绑定特定任务类型、执行环境或评分协议,导致可比性、可解释性和部署决策的可靠性受限。为此我们提出 DAREBench(Deployment-Aware and Reliable Evaluation of Models as Agents),旨在捕捉工作负载差异并提供可靠的代理评估。

DAREBench 基于统一的 OpenClaw 执行环境,将 233 项任务(来源于 22 个基准)组织成 $2\times3$ 的工作负载矩阵,维度为 输入模态(文本 / 多模态)和 执行形式(单步 / 多步 / 工具调用)。所有任务均采用统一的合约式协议进行交互,并通过证据驱动的评分审计确保结果可复现。

我们在该基准上评测了 23 种商业 API 模型和 12 种本地开源权重模型,累计完成 7,587 次模型‑任务运行。评测指标包括准确率、Token 消耗以及对 API 模型的参考成本。实验结果表明:

这些发现提示,模型部署与选型应综合考虑工作负载特征、部署模式以及准确率‑成本的权衡,而非仅依据单一的综合得分。

点评:DAREBench 为模型代理的真实场景评估提供了系统化、可比且可靠的框架,帮助研发者在成本与性能之间做出更理性的部署决策。

原文链接: https://arxiv.org/abs/2609.06059

[h] 返回首页