理解真实物理系统需要超越单纯的目标识别、场景描述和短期视觉预测,因为实际环境往往涉及多个连续场、潜在因果机制、部分可观测性以及对干预高度敏感的动态演化。
我们提出 FireWorldBench,作为一种面向多模态大语言模型和智能体的基准,利用耦合场火焰动力学作为标准化的压力测试环境。火焰的燃烧过程天然包含热场、浓度场、流速场等多物理场的相互作用,能够同步考察状态感知、时序推演、因果解释和干预推理等能力。
基准在两条互补轴上组织:物理能力轴聚焦于对物理状态的理解、时间演化和因果机制的捕获;火灾场景任务轴则围绕不同干预情境设计任务,二者共同覆盖状态推断、动态预测、机制解释和干预评估四大维度。
FireWorldBench 包含 520 条火灾世界实例,其中 494 条为受控仿真世界,26 条对齐真实事件,覆盖 47 种场景原型,分布在 7 个环境家族。每条实例提供结构化文本观测、多个 2D 物理场可视化以及 3D 事件级场景建模,形成 9,074 条文本‑图像交叉的问答对,既有多选题也有开放式报告生成。
该基准旨在检验模型能否从多模态、部分观测中推断潜在物理状态、解释燃烧机制、预测耦合场的演化,并评估不同干预措施的后果,为复杂物理世界智能提供一个高难度的测试平台。
点评:FireWorldBench 将多物理场耦合引入评估体系,为 LLM 与智能体的物理推理设定了前所未有的挑战,也为后续跨模态因果学习提供了丰富的实验资源。