摘要
机器人操作策略依赖于预训练的视觉模型,这些模型提供全局场景嵌入或密集的补丁网格,二者均混合了任务相关与无关的特征。对象中心的槽表示是一种结构化的替代方案:它将特征分组到少数每对象槽中。我们在 ManiSkill3 PickCube-v1 上测试这种结构的价值,使用固定的编码器和保留的种子进行评估。
保持策略、目标标记、渲染和校准不变,仅更改编码器,冻结的对象中心 SPOT 表示(DINO ViT-B/16 + 槽注意力)成功率达到 55.0$\pm$2.9%,比密集的 DINO 全局特征基线高出 22.4%(32.6$\pm$1.5%),且无需对同一可训练策略进行编码器微调。
仅增加标记数量并没有帮助:密集补丁网格即使标记数量是全局特征的 16 倍,表现也没有改善。添加显式的 2D 空间目标和原生分辨率渲染将整个系统的成功率提升至 68.7$\pm$4.2%,接近特权 3D 神谕的上限(71.7$\pm$4.1%)。
随后,自动化运动学故障分类法将空间精度(近失误)故障与对象跟踪(无抓取)故障区分开来:空间定位减少了近失误,而无抓取则保持不变。同样的分类法也适用于更具挑战性的 StackCube-v1,指出遮挡是主要瓶颈。
博主点评: 该研究展示了对象中心表示在机器人操作中的优势,通过结构化特征组来提升性能,表明在视觉运动模仿学习中,结构化信息的有效利用远比单纯增加容量更为重要。这一发现或将引领未来机器人学习策略的创新方向。