Large language model(LLM)代理正被越来越多地用于企业工作流,但现有评估很少检验其决策结论在竞争市场生态中的可迁移性。我们推出 ERPBench,这是一套在六轮企业资源计划(ERP)仿真中执行监控的基准,涵盖定价、生产、采购、库存、财务以及共享市场竞争。
ERPBench 在两种匹配的竞争市场生态中评估同一批 100 组固定问题:
- Solo:每个被测 LLM 代理仅与固定的规则基准对手竞争;
- Arena:六个被测 LLM 代理在同一市场中相互竞争。
在六个模型家族的实验中,共产生 1,200 条模型层级轨迹,覆盖 7,200 次决策回合。结果显示,在当前服务配置下,领先模型在两种生态中不同:Solo 中 DeepSeek 以 2.5229 亿的平均估值(平均排名 1.67)居首;Arena 中 Gemini 以 2.6395 亿的平均估值(平均排名 1.76)领先。两种生态仅在 100 道题目中有 21 道任务的获胜模型相同,且 Gemini 在 Arena 中的底排率从 Solo 的 22% 降至 0%。
ERPBench 支持配对评估企业代理排名在竞争市场生态间的转移情况,并提供聚合的执行干预分析。代码与基准资源已开源,详见 https://github.com/GAIR-NLP/erp-bench。
点评