在许多视觉强化学习(RL)算法中,表示学习通过将潜在距离与由奖励和转移相似性引起的行为距离进行匹配。然而,潜在距离的选择对性能有着显著影响:使用固定的全局规范(如 $\text{l}_p$ 范数或其他手动设计的度量)可能过于限制,无法捕捉行为距离。相反,不受约束的成对距离可能会导致退化解,从而降低度量损失,但并未改善表示。为了解决这一问题,我们提出了 PAMD: 成对自适应马哈拉诺比斯距离,该距离参数化了一种正定的、成对条件的度量,用于测量潜在状态相似性。PAMD 可作为现有基于双模拟方法的简单插件,提供了比固定预设潜在距离更具表现力且结构化的替代方案。我们在视觉 MuJoCo 连续控制任务上对该方法进行了实证验证,结果表明,装备了我们提出的距离的多种近期双模拟基础的 RL 算法的最终性能得到了显著提升。
博主点评: PAMD 方法通过引入灵活的马哈拉诺比斯距离,解决了传统固定度量的局限性,为视觉强化学习提供了新的思路。这种方法不仅能提高性能,还能保持模型的可解释性,值得在未来的研究中进一步探索和应用。