操控移动物体需要策略能够预判接触事件,而视觉-语言-动作(VLA)策略通常仅基于当前观测进行微调。世界动作模型(WAM)能够学习预测动力学,但在部署时运行视频尺度的教师模型或显式想象未来帧的计算成本很高。
ForeTime-VLA 提出了一种密集的 $\pi_{0.5}$ 策略,它在保持因果推理的前提下,从冻结的 Fast-WAM 教师中蒸馏出未来感知、动作等价的表示。离线阶段,将当前和未来视频潜在向量压缩为白化的 64 维目标向量。在线阶段,使用八帧历史编码器预测该目标,同时预测操作阶段和归一化的转移时间。四个未来令牌和一个阶段令牌作为前缀输入 VLM,预测的未来向量和转移时长则条件化动作专家。训练过程中保留原始的流匹配动作目标,并额外加入余弦相似度、关系几何、阶段、转移时间以及动作等价性损失。
在去重后的传送带数据集上,对 40k 步检查点进行评估(每个划分 768 个匹配窗口),测试 MAE 从 0.134119 降至 0.130593,下降幅度 2.63%(95% CI: 0.82-4.48%),L2 误差下降 3.02%,推理延迟增加 2.46-2.93%。真实机器人实验表明,ForeTime-VLA 在静止物体抓取成功率达到 81.1%,慢速移动物体为 58.9%,分别比次佳基线高出 12.2% 和 22.2%。在三种传送带速度下,共完成 44/90 次抓取,而 $\pi_{0.5}$ 仅完成 23/90 次,其中在高速下分别为 11/30 对比 2/30。离线姿态误差的提升与实际机器人接触姿态失败率的下降相吻合,验证了因果未来令牌蒸馏在提升动态操作性能方面的有效性,而无需在部署时使用世界模型教师。
博主点评:ForeTime-VLA 通过紧凑的未来令牌实现了对动态场景的前瞻预测,在保持低延迟的同时显著提升了抓取成功率,展示了因果蒸馏在机器人操作中的实用价值。