摘要
主动推理(AIF)将自适应行为框架化为期望自由能(EFE)的最小化,结合了认知和实用目标于一个单一的变分原理。我们将AIF框架化为策略优化,并展示在闭环控制策略下,EFE最小化可以被表述为一个凸马尔可夫决策过程(MDP)。
在这一框架中,实用项在预测状态边际上是线性的,因此等同于潜在MDP中的奖励最大化,而认知价值则引入了一个非线性组件,使得EFE最小化与标准强化学习有所区别。这一视角进一步揭示了主动推理的认知驱动作为一个依赖于策略的(表现性)奖励。
我们分析了有限时域、折扣和平均奖励的EFE表述,并推导出一个镜像下降(MD)算法,该算法局部线性化当前状态边际周围的目标,从而产生一个与演员-评论家方法和动态规划兼容的依赖于策略的奖励。
最后,我们论证了将世界模型学习与策略优化结合,使主动推理具备表现性强化学习的结构,为将主动推理与现代强化学习和优化理论结合提供了一条路径,包括收敛性分析和原则性的策略改进保证。
博主点评: 本文通过将主动推理与凸马尔可夫决策过程相结合,为理解复杂的自适应行为提供了新的框架。尤其是通过镜像下降算法的引入,展示了策略优化与动态规划的紧密联系,具有重要的理论意义和应用前景。希望未来能看到更深入的实证研究来验证这些理论的有效性。