NeFut Logo NeFut
EN 管理员登录

[AI学术] 基于结果的末端执行器几何跨视觉语言动作策略分析

发布于:2026-09-22 22:00 最后更新:2026-09-24 00:40
#algorithm #AI #Machine Learning

视觉-语言-动作(VLA)策略能够通过不同的动作接口完成同一操作任务,但仅凭任务成功并不能说明它们的物理执行是否一致。我们在四种策略的 15,000 次闭环 LIBERO 回放中,研究了跨策略的末端执行器几何差异。

在干净条件下,构造了 3,600 对配置匹配(因此相互依赖)的策略配对。对于同时成功的配对,中位数归一化动态时间规整(DTW)距离为 $0.0120\ \text{m}$,而恰好有一个策略成功的配对为 $0.0380\ \text{m}$。该顺序在所有任务、所有策略配对以及九种采样和带宽表示中均保持,但比例随表示方式变化数倍,因此我们只报告方向而非固定倍数。

同时失败的配对距离更大,但其分布稀疏且不均匀,故仅作探索性报告。

在成功执行中,替换伙伴导致的几何差异在不同任务之间大于在不同初始状态之间的差异。

即使使用匹配基线,仍能观察到可测量且异质的残余策略差异,说明低跨策略距离并不等同于可互换性。

成功执行与同任务示例之间的距离约等于示例之间的相互距离,表明几何受任务约束主导,但难以将训练数据重叠与任务约束区分开来。

采用统一的 72 步窗口仍保持顺序但降低幅度;端点和时长的调整同样保留正的混合结果系数,只是幅度取决于具体规格。

在复合视觉干扰下,策略排名和配对组成会同步变化。

点评

原文链接: https://arxiv.org/abs/2609.21659

[h] 返回首页