NeFut Logo NeFut
EN 管理员登录

[AI学术] 更少步骤,更佳动作:重新思考 VLA 策略的流匹配推理

发布于:2026-09-22 22:00 最后更新:2026-09-24 00:40
#AI #Machine Learning #optimization

视觉-语言-动作(VLA)策略常使用流匹配方法,通过多次调用动作专家生成动作块。增加积分步数会提升推理成本,却不一定提升闭环成功率。我们提出 Coda,将部分积分预算转移到单一的学习型端点校正上。具体做法是:先让冻结的策略完成少步的噪声到动作的轨迹,然后使用一个轻量级 Transformer 预测一个示例监督的残差,该残差基于候选动作、源噪声以及共享的观测前缀缓存进行计算。仅对校正器进行训练。

在 50 项 RoboTwin Easy 任务上,五步 Coda 将成功率从 71.64% 提升至 74.68%,同时相较于默认的十步策略将前向延迟降低了 30.2%。两步配置实现 71.88% 的成功率,速度提升 $2.12\times$。独立的 13 项对照实验显示,在几乎相同的延迟下提升了 5.69 个百分点,验证了端点校正是替代额外积分的有效手段。相同设计同样提升了冻结的官方 SmolVLA,将两步成功率从 60.8% 提升至 69.4%。这些结果表明,端点校正能够改善冻结流匹配策略的质量‑延迟权衡。

点评

原文链接: https://arxiv.org/abs/2609.21216

[h] 返回首页