世界模型旨在给定当前环境条件预测接下来会发生什么,近年来越来越多地被设计为同时生成多模态输出,例如视觉仿真和文字形式的物理状态。与此同时,多模态生成带来了跨模态不一致的风险:单独评估时每个输出看似可信,却可能相互冲突——模型可能在视频中让球弹起,却在文字描述中省略弹跳,甚至与真实物理规律背离。
本文聚焦两类显式失效:内部错位指同一世界模型生成的视频与其在另一模态(文本)中的预测不一致;外部错位指模型生成的内容与解析得到的物理环境不符。为量化这两种错位,我们提出基于事件、幅度、时序的统一合同,并构建物理驱动的评估管线,使得内部和外部比较均可度量。
在实验中,我们分别向模型提供自身合同(内部设置的 A 梯子)或校正后的物理合同(外部设置的 B 梯子),观察是否能缩小对应的错位。我们在四种机制、二十种情境下进行评估,涵盖不同的物体交互和运动模式。
结果显示,语言模块在所有 22 条文本探针上均能给出与真实环境一致的答案,而对应的视频输出常出现不一致。这表明当前的统一骨干网络难以同时实现正确推理、跨模态内部一致性以及对外部物理真实性的忠实再现。
点评