动作条件视频世界模型旨在预测不同动作下的场景演化,这对可靠的规划和决策至关重要。然而,同一初始场景的多个独立预测虽然各自合理,却可能暗含互相冲突的物理属性(如摩擦系数、质量),导致跨干预的预测不一致,削弱模型的可信度。为了解决这一问题,本文提出 OneWorld——一种共享机制的反事实生成框架,能够在同一潜在物理机制下联合建模多个动作条件的未来。框架首先使用物理机制解释器从每个动作‑结果分支推断潜在机制的分布,这些分布随后被聚合为共享世界证据。该证据衡量各分支是否能够由统一的物理解释支撑,并在信息不足的分支中保留不确定性。共享证据用于约束流式训练并引导采样,使得不同动作产生的结果在底层物理机制上保持一致,同时保留各自的差异。我们进一步在受控环境中引入多干预评估协议,沿用 ACWM‑Phys 的交互设置,检验生成的未来是否能够由相同的物理参数共同解释,并同步报告单次 rollout 的预测质量。实验表明,OneWorld 在提升跨干预物理一致性的同时,单次预测性能保持竞争力。
点评:OneWorld 通过共享潜在机制实现了跨动作的一致性,为可解释的世界模型提供了新思路。