世界模型提供了一条通用的具身智能路径:一次学习可预测的动力学后,即可在其上进行推理、规划和行动。近年来,这类模型的底层表征往往在大规模视频、交互和多模态语料上进行预训练,这引出了一个仅靠预测质量难以回答的问题:何时学习到的表征是真正可操作的?我们发现一种称为反事实崩塌的失效模式:模型能够生成视觉上合理的未来画面,却无法区分导致不同行为后果的干预。这种现象源于表征被优化为感知相似性,而非干预结构——正是大多数大规模预训练编码器的目标。为此我们提出反事实潜在世界模型 (CLWM),其核心包括:
- 循环信念状态编码器,用于聚合历史观测形成潜在信念;
- 条件动作的潜在动力学,预测在给定动作下的潜在转移;
- 对比式反事实目标,强制不同干预产生的未来在潜在空间中保持可分,即使它们的观测看起来相同。
在遮挡操作、别名导航和长时程操作三个基准上,CLWM显著提升了规划成功率。例如在遮挡推送任务中成功率从 $65.1\% \to 74.6\%$,在别名迷宫中从 $67.3\% \to 78.9\%$,并在延迟厨房任务中将利用性规划失误率从 $18.4\% \to 9.7\%$。消融实验表明,收益主要来源于硬反事实负例,尤其是感知别名负例。我们进一步提出反事实可分离度指标,该指标在五类基准模型上与规划成功率呈强相关 ($r \ge 0.94$),且对表征方式无关:只要提供干预‑结果标签,即可在规划器信任之前审计任何编码器,无论是预训练还是从零训练。当前尚未在大规模预训练编码器上进行测评,本文仅在从零训练的世界模型上验证了该指标与规划成功的关系。
点评