NeFut Logo NeFut
EN 管理员登录

[AI学术] CoTinyVLA:低于十亿参数的视觉-语言-行动模型的思维链蒸馏

发布于:2026-07-30 22:00 最后更新:2026-07-30 23:39
#AI #Machine Learning #optimization

Vision-Language-Action (VLA) 模型将自然语言命令转化为机器人动作序列,但在 LIBERO-Plus 鲁棒性基准上,领先的系统使用三到七十亿参数的主干,超出了嵌入式机器人的内存预算。我们提出了 CoTinyVLA,一个基于 Qwen3.5-0.8B 的 0.9B 参数行动模型,通过结构化监督而非扩大模型来实现鲁棒性。

CoTinyVLA 主要包含三个组件,针对问题的不同方面:

  1. 双视角时间输入:每一步使用 16 个历史帧,并带有文本相机和时间标记;
  2. 层次思维链(CoT)蒸馏:从 35B 教师模型进行蒸馏,生成针对任务阶段、夹持器状态和下一个子动作的集成级计划和块级思考;
  3. 释义增强:将 40 个基础命令扩展为 800 个变体。

在 LIBERO-Plus 上,涵盖 10,030 个扰动任务,跨越七个扰动维度,CoTinyVLA 在空间、对象、目标和长期任务上分别达到了 90.8%、87.3%、86.6% 和 80.7%,在所有四个套件中领先于最强的 7B 基线,分别提高了 4.7、2.8、15.9 和 3.0 分,每个间隔均不包括零。收益集中于基准的最困难轴:在发布的十一条基线中,没有一条在任何套件中超过 53.2% 的机器人初始状态,而 CoTinyVLA 在目标上达到了 73.6%,而最强基线为 39.9%。消融实验表明,这三个组件可通过扰动轴分离,且在相同的图像预算下,帧如何在两个相机之间和跨时间分配单独贡献了 8.6 分。闭环推理的 GPU 内存峰值为 2.25 GiB,配对干预显示集成级计划是承载负载:用空或矛盾的跨度替换它会损失 40 到 45 分的成功率。因此,结构化监督使得 0.9B 的主干超越了所有基线。

代码链接:CoTinyVLA GitHub

博主点评: CoTinyVLA 展示了通过结构化监督显著提高小型模型性能的潜力,尤其是在资源受限的环境中。其创新的思维链蒸馏方法为未来的机器人学习提供了新思路,值得深入研究与应用。

原文链接: https://arxiv.org/abs/2607.25487

[h] 返回首页