NeFut Logo NeFut
EN 管理员登录

[AI学术] LayerRoute:面向视觉语言动作策略的动作条件层混合路由

发布于:2026-09-10 22:00 最后更新:2026-09-12 06:35
#Machine Learning #optimization #Neural

Vision‑Language‑Action(VLA)策略通过预训练的视觉语言模型(VLM)为机器人控制提供动作生成依据。VLM 的层次结构从底层的局部几何特征逐渐抽象为与语言对齐的语义表示,不同的操作任务往往需要不同层次的特征组合。与此同时,动作模块在计算过程中会产生中间状态,这些状态在后续决策中可能仍具价值。现有的 VLA 接口在表示访问上缺乏灵活性:VLM 的信息只能通过固定的层映射到每个动作层,而动作的中间状态仅通过残差流隐式传递,无法被显式复用。为此我们提出 LayerRoute,一种动作条件的表示路由接口,能够自适应地访问 VLM 层和动作表示。

LayerRoute 包含两大机制:

  1. Layer Mixture Router 动态构建缓存的 VLM 表示混合,将不同层的特征按需加权组合;
  2. Action‑State Reread 允许后续动作层重新读取并利用前面产生的动作状态。实验在多种仿真和真实环境基准上进行,LayerRoute 在 StarVLA‑$\pi$ 与 $\pi_{0.5}$ 上均实现显著提升,在 LIBERO Long 上最高提升 $7.2$,额外参数仅增加 $0.31\%$(相对)或 $3.87\%$(绝对)。消融实验证实了动作条件层路由的有效性,路由分析进一步揭示了不同任务设置下层分配的结构化模式。

点评:LayerRoute 通过显式的层混合与状态复用,突破了传统 VLA 接口的僵化限制,在保持参数轻量的前提下显著提升了跨任务的鲁棒性和性能,为机器人视觉语言控制提供了更灵活的特征利用框架。

原文链接: https://arxiv.org/abs/2609.06079

[h] 返回首页