在预训练的视觉-语言-行动(VLA)策略中,尽管提供了强大的语言条件操控知识,但它们仍然主要依赖视觉,尤其在接触状态下(如场景被遮挡、深度模糊或小力误差影响执行时)会遇到困难。
为此,我们提出了LIFT(Late Reactive Injection of Force for VLA Post-Training),这是一个力感知的后训练框架,旨在为预训练的VLA策略增加接触反应性,同时保留其一般操控知识。
LIFT通过在原有动作专家旁边grafting一个反应动作专家,利用预训练的动作权重初始化该专家,并通过因果力记忆和零初始化的交叉注意机制注入最近的6D末端执行器力,从而在执行过程中刷新动作。
为了解决接触反馈带来的策略依赖性分布偏移,LIFT进一步将反应力注入与在线DAgger循环结合,训练混合的离线任务对齐数据和人类纠正的在线回放。
在毛巾折叠、书本插入和汉诺塔环放置等任务中,LIFT学习速度更快,性能超过仅依赖视觉的后训练。消融实验表明,反应力记忆和在线纠正数据对于稳健的接触丰富操控都至关重要。我们的代码和数据将公开发布。
博主点评: LIFT框架通过引入力反馈机制显著提升了VLA策略在复杂接触任务中的表现。这种创新的后训练方法展示了如何有效结合离线和在线学习,进一步拓展了机器学习在机器人操控中的应用潜力。对于研究者和开发者而言,这一方法值得深入探索。