NeFut Logo NeFut
EN 管理员登录

[AI学术] 概念引导的空间正则化:提升世界模型在Atari Pong中的表现

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:24
#AI #Machine Learning #optimization

摘要

世界模型通常作为模型基础强化学习(MBRL)系统的组成部分进行评估,而很少单独研究这些模型。我们考察了五个在Atari Pong中的代表性视觉世界模型代理:DreamerV3、DIAMOND、TWISTER、Simulus和STORM。在复现其训练流程并匹配报告的代理性能后,我们冻结学习到的世界模型,并通过闭环回放诊断进行评估:一个与相应MBRL代理分开训练的策略与每个冻结模型互动,生成的视频轨迹被检查以发现视觉和动力学错误。

在所有五个模型中,回放包含明显的失败,包括球体消失、错误的球体运动和无效的球拍与球的互动。除了视觉轨迹外,我们还通过像素空间的零-shot MBRL进行进一步评估,在该方法中,新策略完全在冻结的世界模型内部进行训练,然后在真实环境中进行评估。在所有五个模型中,结果策略的表现明显低于相应原始MBRL训练流程产生的策略。特别是DreamerV3,其平均回报从-5.5下降到-20.9,接近Pong的最低回报-21。

我们假设对任务关键概念(如Pong中的球体)建模不足可能导致这些失败。因此,我们提出了概念引导的空间正则化(CGSReg),这是一种应用于分段概念区域的辅助像素重建损失。实验表明,CGSReg在DreamerV3、DIAMOND和TWISTER中改善了闭环回放和像素空间零-shot MBRL的效果。然而,其在其他模型和评估指标上的效果各不相同,表明CGSReg并未解决所有世界模型的瓶颈。

博主点评: 本文通过对多种世界模型在Pong游戏中的表现进行深入分析,揭示了它们在关键概念建模方面的缺陷,并提出了有效的解决方案。CGSReg的引入展示了如何通过正则化技术提升模型的表现,值得在其他领域进行更广泛的应用研究。

原文链接: https://arxiv.org/abs/2607.15142

[h] 返回首页