本文研究在时变通信网络上进行有限正规形游戏的去中心化学习,目标是收敛到社会最优均衡。每个智能体仅观察自身实现的收益,不事先知道游戏结构,并且只能通过低带宽的消息与随时间变化的邻居通信。
我们设计了一套网络化的去中心化最优均衡学习动力学:智能体基于本地收益比较生成随机的满意/不满意信号,并交换带时间戳的堆叠表格,而不是原始动作、收益或局部估计。表格融合结合时间多数重构,既缓解了动态通信的压力,又保持完全去中心化。
理论上证明,在利用效用或比例公平的社会福利目标下,加入相位探索扰动后,算法在有限时间内可实现对数级 regret,形式为 $R(T)=O(\log T)$。仿真表明,在动态网络环境中,所提方法能够有效选择社会期望的均衡。
点评