NeFut Logo NeFut
EN 管理员登录

[AI学术] VIGOR:基于模型的强化学习中通过潜空间一致性实现零样本视觉泛化

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#algorithm #Machine Learning #optimization

模型基强化学习(MBRL)通过在学习到的潜在动力学中规划,实现了高样本效率。但在出现未见过的视觉干扰(如背景变化、光照变化、相机位移)时,性能会显著下降。视觉干扰首先使编码器输出偏离分布,随后这些误差在规划时的递归潜在滚动中累积,导致两层脆弱性。VIGOR 提出在潜空间保持一致性,以实现零样本的视觉泛化,同时保留 MBRL 的样本效率。VIGOR 包含三部分互补机制:① 异构弱‑强增强,在同一批次中生成仅弱增强和弱‑强增强的潜视图;② 动力学层一致性,通过直接的潜回归,使转移预测对增强保持不变;③ 编码器层稳定化,在动力学层一致性施加的跨增强监督下,防止编码器漂移。实验在 DeepMind Control Suite(DMC)和 Robosuite 上进行,VIGOR 超越最先进的模型自由和模型基基线,在 DMC 上提升 3.4%,在 Robosuite 上提升 43.6%。消融实验表明 VIGOR 的鲁棒性与具体增强方式无关,换用不同扰动族的增强仍能保持强泛化,说明潜空间一致性是核心驱动因素。

点评:VIGOR 通过在潜空间强制一致性,有效抑制了视觉噪声的累积效应,实现了在未见干扰下的零样本适应,展示了模型基强化学习在现实视觉环境中的可行路径。

原文链接: https://arxiv.org/abs/2610.02801

[h] 返回首页