我们研究了一个拥有 652,157 参数的动作条件视觉触觉世界模型,结合了行为克隆、想象中的策略学习、独立的隐式 Q 学习以及模型辅助的力反馈。固定实验协议在 120 个全新 MuJoCo 环境中执行 34 种策略,这些环境在几何形状和物理参数上都有变化;另外在 12 个 ID 环境上独立回放了 324 条动作分支。加入视觉触觉动力学后,力作用效果的均方误差从持久模型的 0.413 N 降至 0.338 N。模型辅助的反馈将 ID 环境下的受力预算成功率从 73.3% 提升至 93.3%,配对差值为 +20.0 [6.7,33.4] 百分点(95% 置信区间),主要出现在脚本化下降阶段,整体 pooled 差值为 +3.9 [-4.5,+11.7] 点。想象中的强化学习实现了 11.9% 的 pooled 联合成功率,而反应式 IQL 达到 25.0%。额外的触觉残差压力测试增加了 330 次执行。实验聚焦于刚性盒子提升的共通方法,未涉及真实机器人迁移或闭环安全保证。
点评