NeFut Logo NeFut
EN 管理员登录

[AI学术] OrchBench:通过确定性仿真独立评估多智能体调度计划

发布于:2026-07-30 22:00 最后更新:2026-07-30 23:39
#algorithm #optimization #Multi-Agent

复杂任务通常可以分解为可并行执行但相互依赖的子任务,因此调度在多智能体系统(MAS)中的性能至关重要。现有评估通常依赖于端到端执行,这将调度计划质量与工作者能力、工具可靠性和环境噪声混为一谈。此外,真实执行的时间和令牌成本随着工作流规模的扩大而迅速增长,使得系统评估变得昂贵。我们提出了OrchBench,一个基于仿真的基准,用于独立评估多智能体调度计划。OrchBench从真实世界任务出发,构建有向无环图(DAG),编码任务依赖关系,具有可控的规模和并行度。给定一个DAG、每个智能体的上下文限制和智能体预算,被评估的规划者将子任务分配给智能体,并指定跨智能体的信息传输及其保留比例。一个确定性模拟器在不调用工作智能体的情况下评估结果计划,并返回可解释的结果质量、完成时间和令牌成本等指标。OrchBench产生的模拟分数与Claude Code执行的质量分数高度相关,Pearson相关系数为$r=0.816$,同时仅需$1.3\\%$的令牌和$10.3\\%$的墙钟时间。在多种规划者和工作流规模下,我们发现保留任务关键性信息比单纯增加智能体数量更为重要,而随着协调失败的累积,平行化的好处逐渐减少。这些结果确立了OrchBench作为比较和诊断多智能体调度计划的高效且可解释的基准。

博主点评: OrchBench的提出为多智能体系统的调度评估提供了一种新的视角,通过仿真避免了真实执行的高成本,同时保持了结果的可靠性。此方法不仅能有效评估调度计划的质量,还能揭示在复杂任务中信息保留的重要性,具有很高的应用价值。

原文链接: https://arxiv.org/abs/2607.25656

[h] 返回首页