NeFut Logo NeFut
EN 管理员登录

[AI学术] 紧凑的视觉触觉世界模型用于提升:预测、奖励对齐与力约束

发布于:2026-09-12 22:00 最后更新:2026-09-15 01:15
#AI #Machine Learning #optimization

我们研究了一个拥有 652,157 参数的动作条件视觉触觉世界模型,结合了行为克隆、想象中的策略学习、独立的隐式 Q 学习以及模型辅助的力反馈。固定实验协议在 120 个全新 MuJoCo 环境中执行 34 种策略,这些环境在几何形状和物理参数上都有变化;另外在 12 个 ID 环境上独立回放了 324 条动作分支。加入视觉触觉动力学后,力作用效果的均方误差从持久模型的 0.413 N 降至 0.338 N。模型辅助的反馈将 ID 环境下的受力预算成功率从 73.3% 提升至 93.3%,配对差值为 +20.0 [6.7,33.4] 百分点(95% 置信区间),主要出现在脚本化下降阶段,整体 pooled 差值为 +3.9 [-4.5,+11.7] 点。想象中的强化学习实现了 11.9% 的 pooled 联合成功率,而反应式 IQL 达到 25.0%。额外的触觉残差压力测试增加了 330 次执行。实验聚焦于刚性盒子提升的共通方法,未涉及真实机器人迁移或闭环安全保证。

点评

原文链接: https://arxiv.org/abs/2609.09597

[h] 返回首页