NeFut Logo NeFut
EN 管理员登录

[AI学术] ERPBench:评估企业决策LLM代理在竞争市场生态中的表现

发布于:2026-09-07 22:00 最后更新:2026-09-08 00:37
#AI #Machine Learning #LLM

Large language model(LLM)代理正被越来越多地用于企业工作流,但现有评估很少检验其决策结论在竞争市场生态中的可迁移性。我们推出 ERPBench,这是一套在六轮企业资源计划(ERP)仿真中执行监控的基准,涵盖定价、生产、采购、库存、财务以及共享市场竞争。

ERPBench 在两种匹配的竞争市场生态中评估同一批 100 组固定问题:

在六个模型家族的实验中,共产生 1,200 条模型层级轨迹,覆盖 7,200 次决策回合。结果显示,在当前服务配置下,领先模型在两种生态中不同:Solo 中 DeepSeek 以 2.5229 亿的平均估值(平均排名 1.67)居首;Arena 中 Gemini 以 2.6395 亿的平均估值(平均排名 1.76)领先。两种生态仅在 100 道题目中有 21 道任务的获胜模型相同,且 Gemini 在 Arena 中的底排率从 Solo 的 22% 降至 0%。

ERPBench 支持配对评估企业代理排名在竞争市场生态间的转移情况,并提供聚合的执行干预分析。代码与基准资源已开源,详见 https://github.com/GAIR-NLP/erp-bench

点评

原文链接: https://arxiv.org/abs/2609.04667

[h] 返回首页