摘要
开放代理系统(OASYS)在现实世界中变得愈发普遍,其中代理和任务的集合会随时间不可预测地变化。这种开放性,包括代理开放性(AO)和任务开放性(TO),对多智能体强化学习(MARL)构成了根本性挑战,因为MARL通常假设状态和动作空间是固定的。现有方法仅部分解决开放性问题:填充和掩码方法引入了人工边界,而最近的基于图或超图的方法处理了开放性的一个维度,但仍然依赖于限制性假设。
在本文中,我们提出了针对代理和任务开放性的指针学习器(PLATO),这是一种基于指针网络的演员,结合了集中式图神经网络(GNN)评论员,在集中训练和分散执行的范式下,通过多智能体近端策略优化进行训练。我们的基于指针的演员直接在当前任务集上输出分布,直接支持变化的动作空间,无需掩码或重新训练。我们的GNN评论员将代理-任务交互编码为一个随着任务和代理组成而变化的图。这两个组件共同考虑了AO和TO,而不受现有方法的边界限制。
我们在任务与代理开放马尔可夫博弈(TaAgO-MG)中形式化PLATO,扩展了之前的任务开放性表述,并证明其在结果不受限的状态和动作空间上是良定义的。我们在开放代理系统评估倡议(MOASEI)野火扑灭领域评估PLATO,这是一个旨在评估开放多智能体系统的环境,并展示出比最先进基线更强的性能和更一致的零-shot泛化能力。
博主点评: PLATO的提出为处理开放性任务提供了一种创新的指针网络解决方案,能够有效应对动态变化的代理和任务集合,展现出强大的性能及泛化能力。这一研究为未来开放代理系统的设计与实现提供了有力的理论基础和实践指导。