在视觉-语言-行动(VLA)模型中,行动监督通常被视为学习行动预测的下游目标。本文则探讨了行动监督如何作为一种力量来塑造继承的多模态表征。研究表明,这种塑造具有双重效应:一方面,它对于形成与行动兼容的表征是必要的;另一方面,当行动监督过于直接地应用于继承的多模态路径时,可能会破坏支持语言处理和物体定位的表征。为了应对这一矛盾,我们提出了Action QFormer,这是一种基于查询的行动面向接口,利用指令条件查询在下游行动生成之前,将继承的多模态信息重组为行动面向的表征。在零-shot 模拟到真实导航中,Action QFormer将平均闭环任务成功率从 18.8% 提高到 56.3%,固定指令的行动生成正确率从 22.5% 提升至 75.5%,并几乎消除了分布外指令生成。进一步的分析显示,Action QFormer改变了行动监督塑造继承多模态表征的方式,减少了广泛的上游重写,同时保留了目标明确且有时具有建设性的行动监督适应。这些结果表明,提高VLA性能不仅需要更强大的预训练骨干网络,还需要更好的选择和组织继承的多模态信息的方法,同时控制其在行动监督下的塑造方式。
博主点评: Action QFormer 的提出为 VLA 模型的性能提升提供了新的视角和方法。这种对多模态信息的重组及其在行动监督下的适应性展示了未来在模型设计上的潜力,尤其是在需要平衡不同任务目标时。其在实际应用中的成功率提升也为相关领域的研究提供了重要的实验依据。