NeFut Logo NeFut
EN 管理员登录

[AI学术] 保持 JEPA 世界模型的可规划性:当帧中移动很少时的挑战与解决方案

发布于:2026-10-06 22:00 最后更新:2026-10-08 01:25
#AI #Machine Learning #Deep Learning

我们提出了 SLIM,一个包含多个小物体的推箱子基准,并为每个场景提供视觉和语言两种目标描述。使用该基准评估 LeWM 世界模型时发现,尽管在模拟器状态下的脚本控制器可以完成所有层级的任务,LeWM 在语言目标下的成功率不足 1%。进一步探查表明,编码器产生的潜在向量对动作几乎不敏感,无法从中解码出推手或物体的位置,滚动预测的效果等同于直接复制当前潜在向量。

为了解决这一问题,我们在训练阶段加入了一项逆动力学辅助损失,该损失同时作用于编码器的潜在向量和通过共享头部预测的潜在向量(该头部在测试时被丢弃)。该改动使所有探针指标恢复,并将成功率从 0.003 提升至 0.35,硬推箱子层级上提升至 0.16(目标无关策略得分为 0)。进一步的对照实验表明,提升主要来源于对编码器的梯度更新。通过一次动作敏感性探针的阈值筛选,我们发现只有当帧中足够多的像素对动作有响应时,模型才能成功规划。

在修复后的潜在空间上,我们训练了一个轻量的语言目标头部,直接从句子生成规划,无需重新训练世界模型。该头部在导航任务上达到 0.84 的成功率(视觉目标上限为 1.00),能够在目标区域被替换为诱饵时仍然跟随正确的名称,并对未见过的名词表现出平滑的退化。单句目标在推箱子任务中仍难以完成,但如果将推箱子过程拆分为多个阶段句子,成功率在中等和困难层级上分别提升至 0.25,与目标帧基准持平,且阶段切换可以仅凭潜在向量读取完成。

原文链接: https://arxiv.org/abs/2610.03137

[h] 返回首页