NeFut Logo NeFut
EN 管理员登录

[AI学术] MA-WAM:用于测试时规划的多智能体世界-动作模型

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#algorithm #AI #Machine Learning

多智能体协作任务要求不同智能体同时执行联合动作,且每个智能体的动作会影响其他智能体的观测和响应。因此,需要一个世界模型来预测所有智能体联合动作产生的团队回报。直接把单智能体世界模型套用到每个智能体上逐步预测团队回报的做法,无法捕捉同时动作之间的依赖关系。为此我们提出 MA-WAM(Multi-Agent World-Action Model),一种在测试时进行规划的框架,能够让冻结的多智能体 flow 策略评估候选联合动作的未来。MA-WAM 是首个针对多智能体 flow 策略的测试时世界模型规划器。它依据跨智能体的依赖关系预测每个联合动作的后果,并实现高效的候选动作打分。实验在 MAMuJoCo、SMAC、MPE 共 30 种离线 MARL 场景中进行,MA-WAM 相比直接执行平均提升 22.0%,相比均匀动作选择提升 25.6%。在 A100 GPU 上的标准评估协议下,MA-WAM 额外耗时 12.1 ms,仅占生成‑打分总时长的 2.5%。

点评

原文链接: https://arxiv.org/abs/2609.31281

[h] 返回首页