摘要
世界模型通常作为模型基础强化学习(MBRL)系统的组成部分进行评估,而很少单独研究这些模型。我们考察了五个在Atari Pong中的代表性视觉世界模型代理:DreamerV3、DIAMOND、TWISTER、Simulus和STORM。在复现其训练流程并匹配报告的代理性能后,我们冻结学习到的世界模型,并通过闭环回放诊断进行评估:一个与相应MBRL代理分开训练的策略与每个冻结模型互动,生成的视频轨迹被检查以发现视觉和动力学错误。
在所有五个模型中,回放包含明显的失败,包括球体消失、错误的球体运动和无效的球拍与球的互动。除了视觉轨迹外,我们还通过像素空间的零-shot MBRL进行进一步评估,在该方法中,新策略完全在冻结的世界模型内部进行训练,然后在真实环境中进行评估。在所有五个模型中,结果策略的表现明显低于相应原始MBRL训练流程产生的策略。特别是DreamerV3,其平均回报从-5.5下降到-20.9,接近Pong的最低回报-21。
我们假设对任务关键概念(如Pong中的球体)建模不足可能导致这些失败。因此,我们提出了概念引导的空间正则化(CGSReg),这是一种应用于分段概念区域的辅助像素重建损失。实验表明,CGSReg在DreamerV3、DIAMOND和TWISTER中改善了闭环回放和像素空间零-shot MBRL的效果。然而,其在其他模型和评估指标上的效果各不相同,表明CGSReg并未解决所有世界模型的瓶颈。
博主点评: 本文通过对多种世界模型在Pong游戏中的表现进行深入分析,揭示了它们在关键概念建模方面的缺陷,并提出了有效的解决方案。CGSReg的引入展示了如何通过正则化技术提升模型的表现,值得在其他领域进行更广泛的应用研究。