Offline 多智能体强化学习(MARL)在固定数据集上学习协作策略,部署后策略保持不变。冻结的策略在执行时一次性给出联合动作并直接执行。
这种一次性部署往往会因缺乏后续调整而陷入次优方案,即使行为数据中仍存在更好的邻近动作也无法被利用。
为了解决此问题,本文提出 Gradient Guided Multi Agent Flow (G2MAF),一种在测试时对联合策略进行细化的框架。G2MAF 通过一个全局归一化、投影后的 critic 梯度,对所有智能体的动作修正进行统一引导和协同,同时保证修正后的动作仍然可行且与冻结策略的原始提案保持接近。
在 24 个 MPE 与 SMAC 场景中进行实验,G2MAF 的标准变体在 20 个冻结设置上实现了提升,MPE 场景的平均相对增益为 9.2%,SMAC 场景为 8.9%,模型推理延迟仅增加约 6%。
实验结果表明,利用测试时梯度引导可以在保持低计算开销的前提下显著提升离线 MARL 的部署性能。
点评