我们给出一种强化学习占用度量的全新表述:通过 重置规划过程 将规划准则嵌入系统动力学,得到其稳态分布——访问度量(visitation measure)。该度量是信息几何自然刻画决策的核心对象。所有可实现的访问度量构成一个 双对偶平坦统计流形,其两套仿射坐标分别是 访问概率 $\pi(s,a)$ 和 对数策略 $\log \pi(s,a)$,两者在 条件熵 $H(\pi)= -\sum_{s,a}\pi(s,a)\log \pi(s,a)$ 下互为对偶。
该结构使得 规划即推理 能够从线性奖励推广到访问度量的非线性泛函;每一次迭代只需一次 自然梯度 步骤即可求解。与此同时,时序差分误差(TD error)被解释为 边际效用估计。我们进一步阐述了该几何框架在强化学习算法设计以及理论神经科学中的意义。
点评:双对偶平坦流形为规划提供了统一的几何视角,既保留了信息论的对偶结构,又自然引入自然梯度与 TD 误差的解释,为非线性奖励的优化奠定了理论基础。