NeFut Logo NeFut
EN 管理员登录

[AI学术] 提升结构性而非容量:面向视觉运动模仿学习的对象中心表示

发布于:2026-07-15 22:00 最后更新:2026-07-17 08:46
#AI #Machine Learning #optimization

摘要

机器人操作策略依赖于预训练的视觉模型,这些模型提供全局场景嵌入或密集的补丁网格,二者均混合了任务相关与无关的特征。对象中心的槽表示是一种结构化的替代方案:它将特征分组到少数每对象槽中。我们在 ManiSkill3 PickCube-v1 上测试这种结构的价值,使用固定的编码器和保留的种子进行评估。

保持策略、目标标记、渲染和校准不变,仅更改编码器,冻结的对象中心 SPOT 表示(DINO ViT-B/16 + 槽注意力)成功率达到 55.0$\pm$2.9%,比密集的 DINO 全局特征基线高出 22.4%(32.6$\pm$1.5%),且无需对同一可训练策略进行编码器微调。

仅增加标记数量并没有帮助:密集补丁网格即使标记数量是全局特征的 16 倍,表现也没有改善。添加显式的 2D 空间目标和原生分辨率渲染将整个系统的成功率提升至 68.7$\pm$4.2%,接近特权 3D 神谕的上限(71.7$\pm$4.1%)。

随后,自动化运动学故障分类法将空间精度(近失误)故障与对象跟踪(无抓取)故障区分开来:空间定位减少了近失误,而无抓取则保持不变。同样的分类法也适用于更具挑战性的 StackCube-v1,指出遮挡是主要瓶颈。

博主点评: 该研究展示了对象中心表示在机器人操作中的优势,通过结构化特征组来提升性能,表明在视觉运动模仿学习中,结构化信息的有效利用远比单纯增加容量更为重要。这一发现或将引领未来机器人学习策略的创新方向。

原文链接: https://arxiv.org/abs/2607.09825

[h] 返回首页