NeFut Logo NeFut
EN 管理员登录

[AI学术] 单模型双物理叙事:多模态世界建模中的错位审计

发布于:2026-09-16 22:00 最后更新:2026-09-18 00:46
#algorithm #AI #Machine Learning

世界模型旨在给定当前环境条件预测接下来会发生什么,近年来越来越多地被设计为同时生成多模态输出,例如视觉仿真和文字形式的物理状态。与此同时,多模态生成带来了跨模态不一致的风险:单独评估时每个输出看似可信,却可能相互冲突——模型可能在视频中让球弹起,却在文字描述中省略弹跳,甚至与真实物理规律背离。

本文聚焦两类显式失效:内部错位指同一世界模型生成的视频与其在另一模态(文本)中的预测不一致;外部错位指模型生成的内容与解析得到的物理环境不符。为量化这两种错位,我们提出基于事件、幅度、时序的统一合同,并构建物理驱动的评估管线,使得内部和外部比较均可度量。

在实验中,我们分别向模型提供自身合同(内部设置的 A 梯子)或校正后的物理合同(外部设置的 B 梯子),观察是否能缩小对应的错位。我们在四种机制、二十种情境下进行评估,涵盖不同的物体交互和运动模式。

结果显示,语言模块在所有 22 条文本探针上均能给出与真实环境一致的答案,而对应的视频输出常出现不一致。这表明当前的统一骨干网络难以同时实现正确推理、跨模态内部一致性以及对外部物理真实性的忠实再现。

点评

原文链接: https://arxiv.org/abs/2609.14833

[h] 返回首页