世界动作模型(WAM)通过从初始观察和指令 jointly 预测未来视觉动态和动作,已成为机器人控制的有前景范式。然而,现有 WAM 在长时程预测上表现不佳,因为生成密集视频回滚效率极低。近期一些 WAM 只预测单帧未来画面,省去完整视频生成,但这忽略了任务进展的引导。
我们提出 ProWAM——一种渐进式世界动作模型,它同时预测动作和有序的稀疏视觉子目标序列,为整个任务执行提供明确的视觉锚点。子目标预测可以从大规模无动作视频中学习,使视频骨干网络承担复杂的视觉规划工作,减轻动作策略的负担。
为实现高效动作生成,ProWAM 只进行一次视频骨干前向传播以缓存稀疏子目标特征,避免了迭代的全视频生成,仅在重新规划时进行轻量级动作去噪。
在广泛的评估中,ProWAM 展现出卓越的分布外鲁棒性。模拟基准上,ProWAM 在 LIBERO‑Plus 达到 85.8% 成功率、在随机化 RoboTwin 达到 75.7%,相较最强基线最高提升 +35.9%。在 RoboCasa365 上取得 48.1% 成功率,Composite‑Unseen 子集为 18.2%,整体排名第 4。更重要的是,在零样本真实世界实验中,ProWAM 达到 70.0% 成功率,较最强基线的 55.0% 提升 15.0%(相对增幅 27.3%)。
这些结果证明了进度索引视觉前瞻在闭环控制中的价值。项目代码与演示页面请访问 https://sii-ferenas.github.io/ProWAM-page。
点评:ProWAM 通过稀疏子目标的进度指引,实现了高效且鲁棒的长时程视觉规划,为实际机器人任务提供了可行的闭环控制方案。