模型基强化学习(MBRL)通过在学习到的潜在动力学中规划,实现了高样本效率。但在出现未见过的视觉干扰(如背景变化、光照变化、相机位移)时,性能会显著下降。视觉干扰首先使编码器输出偏离分布,随后这些误差在规划时的递归潜在滚动中累积,导致两层脆弱性。VIGOR 提出在潜空间保持一致性,以实现零样本的视觉泛化,同时保留 MBRL 的样本效率。VIGOR 包含三部分互补机制:① 异构弱‑强增强,在同一批次中生成仅弱增强和弱‑强增强的潜视图;② 动力学层一致性,通过直接的潜回归,使转移预测对增强保持不变;③ 编码器层稳定化,在动力学层一致性施加的跨增强监督下,防止编码器漂移。实验在 DeepMind Control Suite(DMC)和 Robosuite 上进行,VIGOR 超越最先进的模型自由和模型基基线,在 DMC 上提升 3.4%,在 Robosuite 上提升 43.6%。消融实验表明 VIGOR 的鲁棒性与具体增强方式无关,换用不同扰动族的增强仍能保持强泛化,说明潜空间一致性是核心驱动因素。
点评:VIGOR 通过在潜空间强制一致性,有效抑制了视觉噪声的累积效应,实现了在未见干扰下的零样本适应,展示了模型基强化学习在现实视觉环境中的可行路径。