ERPBench 提出了一种基于系统状态的评估范式,专门用于检验仅通过截图和模拟点击操作的计算机使用代理在企业资源计划(ERP)系统中的表现。ERP 软件界面密集、交互步骤多且需要跨页面协同,错误往往会直接写入持久化的业务记录,而不是仅在屏幕上显现,这对传统的桌面/网页基准构成了挑战。
为了解决上述问题,作者构建了 ERPBench 基准:在一套可复现的真实 ERP 环境中运行代理,仅允许其读取屏幕截图并提交动作;每个任务的结果会与后台数据库中的真实值对比,从而得到精确的成功率。基准还配备了生产级的控制器,所有代理的操作必须经过人工批准后才能生效,确保安全部署。
在对六款闭源和开源代理进行评测后发现,虽然这些模型在通用 GUI 任务上表现优异,但在企业场景下的可靠性并未得到保证。即便代理能够正确打开目标表单并成功保存,实际写入的记录往往错误:最高保存成功率可达 85%,但正确写入的比例低至 3%。作者进一步分析了企业工作流特有的失效模式,包括表单字段映射错误、事务提交顺序混乱以及异常回滚未被捕获等。
该工作表明,面向企业软件的评估需要超越表面交互的成功率,必须关注数据持久化的准确性和业务流程的完整性,为后续计算机使用代理的安全落地提供了重要基准。
点评