我们展示了用户如何借助大语言模型(LLM)和大视频模型代理,创建并操控因果虚拟世界。核心方法是使用反馈模糊认知图(FCM)来刻画虚拟世界的细粒度因果结构,并引导其因果演化。局部因果规则是部分或模糊的,而FCM的反馈结构会产生全局平衡,定义出因果场景。
一系列形式为“如果 $\mathcal{A}$ 则 $\mathcal{B}$”的动态元规则描述视频的因果场景。若部 $\mathcal{A}$ 在用户或代理的控制下扰动FCM,FCM的瞬时反馈动力学决定元规则的因果箭头,随后部 $\mathcal{B}$ 表现为平衡吸引子,如FCM的极限环或固定点。
我们的算法从FCM中提取这些元规则,指引LLM代理依据元规则序列撰写脚本。大视频生成器再依据脚本和动力学流将元规则转化为视频场景。
实验中,我们将该技术应用于描述海豚与鲨鱼的海底世界的简易FCM。Google Gemini 3.1负责生成脚本,Google Veo 3.1负责生成海豚‑鲨鱼视频。该方法具备通用性,可通过组合更大的FCM和AI代理,实现更沉浸式的虚拟世界。
点评