Vision-Language-Action(VLA)模型在机器人控制上展现出强大潜力,但训练它们需要海量高质量的模仿学习数据。更重要的是,现有 VLA 并未显式构建世界模型,这使得其对真实环境动态的推理能力受到质疑。
本文提出一种新颖的架构:在 VLA 的视觉编码器产生的嵌入空间上训练一个预测式世界模型。我们假设这些嵌入保留了与动作相关的信息,因而可以用于预测未来状态。与传统像素空间的世界模型不同,损失直接作用于嵌入向量,这类似于联合嵌入预测网络的做法。
该世界模型训练完成后,可用于短期规划:给定目标图像,模型通过采样 VLA 的动作序列来实现从当前状态到目标的过渡。通过实验我们将评估视觉嵌入的丰富性,并验证在加入世界模型后是否能够显著降低对大规模模仿数据的依赖,同时在推理阶段直接生成行动计划。
整体思路是:①在 VLA 的视觉编码器输出上构建预测模型;②利用动作条件化的嵌入预测检验 VLA 是否具备隐式的、非失真的世界模型;③将训练好的模型用于目标导向的动作采样,实现规划与控制的闭环。
点评