灵活的机器人生产需要在工序进度、物料路由、资源分配、临时协作以及同步执行之间做出联合决策,因为每一项决策都会影响其他决策的可行性。去中心化控制下,每个机器人只能获取有界的局部信息,而系统整体的进展却依赖于全局的资源共享、物料状态以及工作空间的兼容性,这正对应了部分可观测下的多智能体协同决策与资源竞争问题。
本文提出 AssemblyGrid v1,一个可复现的基准,用于重复的多机器人生产任务。它在单一任务层面同时建模了显式的工序进度、去中心化观测、物料转移、临时多机器人联盟、并行执行以及几何约束的可行性。基准包含 Flow、Coalition、Concurrency 三大工作负载族,每族提供三个难度层级。任务成功判定与评估指标独立于学习奖励或求解方法,使得基于学习的算法和非学习方法能够在同一生产问题上公平比较。
评估分为可执行性一致性检查、机制分析以及算法实验三部分。实验使用了特权的集中式参考控制、结构化的去中心化控制器以及多智能体强化学习(MARL)方法,包括 IPPO、MAPPO 与 QMIX。结果表明,无论是集中式还是去中心化控制,都能够实现生产任务的有效执行。MARL 实验进一步展示了仅凭局部观测和动作,去中心化策略同样能够学习到高效的生产行为,验证了 AssemblyGrid 作为研究灵活机器人生产中协同决策的受控基准的价值。
点评:AssemblyGrid v1 将多机器人生产的关键难点统一到可量化的基准中,为算法比较提供了统一平台,尤其在验证去中心化学习策略的可行性方面具有重要意义。