NeFut Logo NeFut
EN 管理员登录

[AI学术] G2MAF:测试时梯度引导的多智能体流策略

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#algorithm #AI #Machine Learning

Offline 多智能体强化学习(MARL)在固定数据集上学习协作策略,部署后策略保持不变。冻结的策略在执行时一次性给出联合动作并直接执行。

这种一次性部署往往会因缺乏后续调整而陷入次优方案,即使行为数据中仍存在更好的邻近动作也无法被利用。

为了解决此问题,本文提出 Gradient Guided Multi Agent Flow (G2MAF),一种在测试时对联合策略进行细化的框架。G2MAF 通过一个全局归一化、投影后的 critic 梯度,对所有智能体的动作修正进行统一引导和协同,同时保证修正后的动作仍然可行且与冻结策略的原始提案保持接近。

在 24 个 MPE 与 SMAC 场景中进行实验,G2MAF 的标准变体在 20 个冻结设置上实现了提升,MPE 场景的平均相对增益为 9.2%,SMAC 场景为 8.9%,模型推理延迟仅增加约 6%。

实验结果表明,利用测试时梯度引导可以在保持低计算开销的前提下显著提升离线 MARL 的部署性能。

点评

原文链接: https://arxiv.org/abs/2609.31286

[h] 返回首页