NeFut Logo NeFut
EN 管理员登录

[AI学术] 进化稳定性不等同于学习可达性:多智能体强化学习视角下的合作出现

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#algorithm #AI #Machine Learning

合作的出现是多智能体系统的核心难题,去中心化的智能体需要在不断变化的对手行为中实现协同。进化博弈理论能够识别策略上稳定的结果,但在固定的种群调整动态下,这种稳定性并不必然意味着有限样本的学习智能体能够通过局部奖励反馈达到同样的结果。

本文以一个由政府、平台企业和用户组成的三方治理博弈为例,进行透明化分析。我们首先推导了该静态阶段博弈的复制子动力学(replicator dynamics),其一般形式为

$$ \dot{x_i}=x_i\big[(A\mathbf{x})_i-\mathbf{x}^T A \mathbf{x}\big] $$

其中 $x_i$ 表示策略 $i$ 的占比,$A$ 为收益矩阵。随后在对称初始条件网格上评估了合作的进化基底(evolutionary basin),其体积 $V_E=1.00$,表明在整个采样空间内合作是进化稳定的。

接下来,我们在相同的收益环境下,对三种去中心化的基于价值的学习者进行实验:独立 $\varepsilon$-贪婪 Q 学习($\varepsilon$-IQL)、尺度化 Boltzmann 探索以及 SA–EA BQL。学习基底(learning basin)通过在相同网格上统计能够收敛到合作联动的初始点比例得到。结果显示 $\varepsilon$-IQL 的学习基底为 $0.88$,而尺度化 Boltzmann 和 SA–EA BQL 均为 $0.00$。

诊断轨迹表明,即使行为多样性更广、价值分离非零,固定配置下仍可能无法维持合作联动。这说明进化稳定性与学习可达性是耦合博弈–学习系统的两种独立属性。

本文以共享单车场景作为动机应用,提出的框架可用于比较种群层面的稳定性与在特定多智能体学习动态下合作的有限样本可达性。

点评

原文链接: https://arxiv.org/abs/2609.27664

[h] 返回首页