当前的世界模型通常在单一抽象层次上运行,虽然注重感知的真实度,但缺乏真实世界下游任务所需的空间推理和语义理解。我们提出了一种层次化的驾驶世界模型,能够在不同时间和抽象层次上分解未来预测:高层预测器用于预测长时间范围内的粗略场景结构,而低层生成器则基于高层输出生成详细预测。这种分解方式不仅实现了高感知真实度,还捕获了强大的空间和语义表示。
我们进一步展示,通过扩散强制目标进行预训练,相较于标准的教师强制目标,模型内部表示更加丰富;而教师强制——仅从干净的上下文预测下一帧——则产生更稳定的自回归生成。因此,我们引入了一种通用的两阶段训练范式,先用扩散强制进行预训练,再使用教师强制进行微调,结合了前者的表示优势和后者的生成稳定性。
我们的方法在标准驾驶世界模型评估的多个基准测试上取得了最先进的结果,包括长时间生成真实度、在反事实场景下的转向响应性,以及内部表示质量。项目页面包含代码、演示、检查点和定性结果:Orbis 2 Project
博主点评: Orbis 2通过层次化的设计提升了驾驶世界模型的表现,尤其是在长时间预测和空间理解方面,展现了前所未有的潜力。这一创新不仅推进了自动驾驶技术的发展,也为相关领域的研究提供了新的思路。其两阶段训练方法的有效性值得关注,可能成为未来模型训练的主流趋势。