NeFut Logo NeFut
EN 管理员登录

[AI学术] 元多智能体强化学习用于交互策略的快速适应及其在自动驾驶中的应用

发布于:2026-10-02 22:00 最后更新:2026-10-06 12:11
#algorithm #AI #Machine Learning

本文提出一种元多智能体强化学习(meta-MARL)框架,用于在多智能体系统中实现交互策略的快速适应。元强化学习通过双层优化使智能体能够在新任务或环境中迅速调整策略,但现有方法主要针对单智能体,难以直接推广到多智能体场景,因为任务不仅受环境影响,还受各智能体的策略交互支配。为此,我们将多智能体强化学习问题建模为马尔可夫博弈(Markov Game),在一系列博弈分布上学习能够快速迁移的策略。文中引入“元纳什均衡”(meta-NE)概念,作为元-MARL 问题的目标解。我们证明,在满足一定光滑性条件下,meta-NE 与基于梯度博弈的元学习算法的固定点等价,从而为算法收敛提供理论依据。实验在自动驾驶交互场景中进行,对比了预训练的 MARL 基线,结果显示元-MARL 能在更少的交互回合内达到相似或更优的性能,验证了框架的有效性。

该工作展示了元学习与多智能体博弈的自然结合,为实际需要快速策略迭代的系统(如车路协同、机器人协作)提供了可行的技术路径。

点评

原文链接: https://arxiv.org/abs/2610.00705

[h] 返回首页