在基于模型的强化学习代理DreamerV3家族中,当训练在任务序列上进行时,即使不受限的重放缓冲区保存了所有早期经验,代理仍会发生灾难性遗忘。我们提出一个在持续强化学习文献中被假设但从未测量的问题:究竟哪个组件在遗忘?在不明确的重放策略下,通过预注册的组件级探测(n=3 seeds),结果表明,世界模型几乎保留了关于旧任务的所有可测量信息——奖励区分(保留比率 ~1.0)、价值估计和终止结构,而行为者的表现却崩溃。在这种情况下,遗忘是一个通道问题,而非记忆问题。我们通过干预实验证明了这一点:当世界模型被冻结并进行相同的想象回放时,想象中的强化学习无法恢复丢失的技能(0/3 seeds),而在世界模型自身的分级梦境上进行监督自我模仿,则在与环境零交互的情况下,成功恢复了技能(3/3 seeds)。
在训练过程中交替进行的分级梦境排练,产生了一个无任务标签、参数恒定的持续学习者:在普通重放为0/3的情况下,3/3保留了四任务链,3/3保留了八任务链,并且在匹配真实情节克隆上取得了一致的增益(配对差异 +0.13,bootstrap 95% CI [0.07, 0.24],完全种子分离)。梦境评分步骤是负载支撑的:我们特征化了两种评分失败模式,提供了一个离线选择标准,能够在结果被污染之前捕捉到这两种模式,并给出了一个实现优先的评分规则来解决这些问题。所有实验均按照预注册的协议进行;每个被反驳的假设都已报告。
博主点评: 本文揭示了在持续强化学习中,世界模型的稳定性与行为者的遗忘之间的微妙关系,强调了梦境排练在技能恢复中的重要性。这为未来的研究提供了新的视角,尤其是在任务迁移与持续学习领域的应用潜力,值得深入探索。