NeFut Logo NeFut
EN 管理员登录

[AI学术] 机器人行动表示的语义锚定革命

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:19
#AI #Machine Learning #optimization

在视觉-语言-行动(VLA)模型中,预训练的视觉-语言模型赋予了丰富的语义表示,但在有限的机器人演示上进行微调会削弱这种结构,并降低泛化能力。因此,一个基本问题随之而来:什么构成了良好的行动表示?

受到镜像神经元理论的启发,我们探讨了机器人的行动表示是否能够保留预训练编码器所捕获的语义结构。系统性的探测确认,这种结构在微调过程中确实会遭到侵蚀,其质量与任务成功率和分布外泛化能力同步变化。

为了解决这一问题,我们提出了一种即插即用的方法,将行动表示锚定到语义流形,同时将表示分解为共享语义通道和私有通道,在推理时全部丢弃,从而保持已部署模型的不变性。

通过在不同的VLA骨干网络上进行验证,该方法在仿真和现实世界基准测试中均表现优异,在现实世界的同类任务上提升了最高18.7%的准确率,并在分布外泛化上提高了21.5%。

博主点评: 该研究通过语义锚定方法有效解决了机器人行动表示的泛化问题,为机器人学习的可解释性和效果提升提供了新的方向,展现了镜像神经元理论在机器人领域的应用潜力。

原文链接: https://arxiv.org/abs/2607.13597

[h] 返回首页