在本文中,我们提出了切换非平稳马尔可夫决策过程(SNS-MDP)框架,其中环境在有限数量的马尔可夫决策过程(MDP)之间切换,由潜在马尔可夫链控制,而智能体仅观察外部状态。我们证明了这种切换的长期效果等同于由隐藏马尔可夫链的平稳分布参数化的平稳动态。
对于固定策略,我们推导出SNS价值函数的闭式表达式,并证明标准的时间差分(TD)学习在持续非平稳的情况下几乎必然收敛到该价值函数。此外,我们还证明了策略迭代收敛于等效平均环境的最优策略,并且表格Q学习几乎必然收敛到最优Q函数。该框架在具有马尔可夫信道噪声的无线通信网络中得到了验证,展示了其在快速变化系统中的决策有效性。
博主点评: 本文通过引入SNS-MDP框架,为非平稳环境下的强化学习提供了新的理论基础,尤其是在复杂决策问题中展现出良好的适应性和收敛性。这为未来在动态系统中的应用开辟了新的方向。