在视觉-语言-行动(VLA)模型中,尽管在视觉运动策略学习方面取得了显著成果,但其本质上仍然是反应性的,仅仅将当前观察和语言映射到动作,缺乏对世界动态的明确前瞻性预测。现有的视觉前瞻方法能够预测未来的视觉状态,但缺乏明确的运动引导:它们展示了去往何处,但没有说明如何到达。
我们认为,未来特征预测与稀疏点跟踪是自然互补的:前者提供目标状态,后者则捕捉通向目标的连续运动路径。为此,我们提出了FoMoVLA框架,通过联合学习未来特征前瞻与稀疏的2D点跟踪,增强VLA表示的时空监督,从而提升连续动作策略。
FoMoVLA引入紧凑的前瞻性标记以解码未来特征状态,并解码稀疏的时间2D点轨迹以建模紧凑的几何运动。两者通过轻量级的未来条件交叉注意模块耦合,使得对预期状态与点动态之间的推理保持一致。我们在LIBERO、RoboCasa GR-1 Tabletop和LIBERO-Plus上的大量实验展示了其在性能上的领先地位以及强大的零-shot泛化能力。项目页面可访问 FoMoVLA Project。
博主点评:FoMoVLA通过将视觉前瞻与运动引导结合,显著提升了VLA模型在复杂环境中的决策能力。这种方法不仅增强了模型的推理能力,也为未来的研究拓宽了思路,尤其是在动态场景下的应用潜力令人期待。其在多个基准数据集上的优异表现,证明了该框架的有效性和实用性。