AgBench 是一个面向个人 AI 设备的代理式 AI 基准套件,提供可复现的评估流程。当前的代理式 AI 系统大多依赖云端大语言模型进行规划、工具使用和迭代执行,导致 API 成本高且数据可能泄露。个人设备的算力提升使得本地执行成为可能,但受限于 CPU、内存等资源,可能影响任务成功率和响应时间。已有的基准缺乏对设备、工作负载和部署架构之间权衡的系统化刻画。AgBench 通过统一的工作负载集合,分别在本地、混合和全云三种模式下测量任务成功率、延迟、云 API 成本和数据暴露程度。实验收集超过 162.07 万条数据,结果表明:个人设备能够本地完成多数代理任务,但仅本地执行的成功率普遍低于全云,且在并发增多时完成时间显著延长。本地执行可完全消除云模型费用和敏感信息泄露。混合执行在提升成功率方面有优势,但其云成本和数据暴露取决于任务划分和信息共享方式。没有一种架构在成功率、吞吐量、云成本和数据安全上全面占优,部署方案应依据具体工作负载和设备能力进行选择。AgBench 项目代码与数据已公开:https://anonymous.4open.science/r/AgBench-2777。
点评