在大型语言模型不断发展为能够理解用户请求、调用外部工具并通过交互完成复杂任务的通用代理之际,现有的代理基准测试往往集中于有限的场景、工具生态系统或交互格式,这使得系统性地表征模型在异构应用环境中的能力变得困难。为此,我们引入了 OmniaBench,一个用于评估通用代理在多样化场景中的基准测试,具有明确的状态空间。
我们从应用商店、产品文档、行业资源、网络检索和人工精炼中提取应用导向的场景知识,形成一个涵盖 ToC、ToB 和 ToE 的层次分类法,包含 90 个一级和 354 个二级领域。基于此分类法,我们构建了可执行环境,并通过四条互补路径(DAG、DAG-S、Solver 和 Program)合成单轮和多轮任务。
OmniaBench 进一步引入了十维能力分类法和八个组成原子难度因子,以支持细粒度的评估和分析。最终生成的数据集包含 1,431 个任务,以及一个包含 644 个挑战性子集的任务,旨在降低评估成本并减轻公共发布后全套数据可能的污染。
该基准测试对当前前沿模型提出了重大挑战,即使是 Claude-Sonnet-5 和 GPT-5.6-Sol 的 Overall Pass@1 分数也仅为 58.54 和 57.14。进一步的分析揭示了不同领域和能力之间的明显差异,以及在规划、约束维护和自适应纠正方面的持续局限性。OmniaBench 提供了一个广泛且诊断性的基准,用于表征通用代理的能力边界。
博主点评: OmniaBench 作为新兴的基准测试,填补了现有评估工具的空白,尤其是在多样化场景下的应用能力评估。这一研究不仅为开发更强大的AI代理提供了参考框架,也为后续研究提供了宝贵的数据支持。其挑战性任务集将推动AI模型在复杂任务处理中的进步。