摘要
在多智能体强化学习(MARL)中,合作任务要求智能体共同最大化共享回报。在集中训练与分散执行(CTDE)范式下,策略梯度的计算一直较为困难。以往的方法主要有两种:独立因子更新与集中式评估,这种方法在没有价值分解假设的情况下缺乏一般的联合改进保证;或者是交替的最佳响应更新,这可能收敛到次优的纳什均衡。
在本文中,我们展示了联合策略梯度可以精确地分解为每个智能体的独立项,每个项由每个智能体的评分函数和分散式评估组成。基于这一分解,我们开发了智能体链式策略优化(ACPO),其中演员独立训练,其更新共同构成联合策略梯度上的单一步骤。这一结果的核心是将智能体的同时联合决策视为序列化的过程,智能体一次性提交动作,且每个动作的选择依赖于对前一个动作的信念,这将独立的每个智能体的更新联系成一个单一的联合步骤。
我们在多机器人仓库、SMACv2 和 MA-MuJoCo 上评估了 ACPO 的在线和离线实现,结果显示其优于强基线,且随着智能体数量的增加,差距进一步扩大。
博主点评: ACPO 方法通过有效的策略梯度分解,解决了多智能体强化学习中的关键挑战,展示了在复杂合作场景中提升性能的潜力。这一创新不仅推动了理论的发展,也为实际应用提供了新的思路。尤其是在多智能体系统中,ACPO 的独立训练策略为未来的研究提供了广阔的空间。