统一多模态模型的目标是实现任意模态之间的相互理解与生成。然而,现有方法主要依赖隐式统计相关性,缺乏跨模态结构一致性约束,导致语义漂移、组合泛化差以及干预下的不稳定性。\
本文提出 C3‑UniMM 框架,核心是因果循环一致性(Causal Cycle Consistency)和超级对齐(Super Alignment)。我们构建了结构化潜在因果图(Structured Latent Causal Graph,SLCG),作为共享的跨模态语义空间,并设计统一的多模态编码块,使得理解与生成在同一因果语义结构中协同优化。\
在生成阶段,引入统一解码空间(Unified Decoding Space),强制跨模态映射保持结构不变并具备语义可逆性。形式化地,设 $f: X \rightarrow Z$ 为编码映射,$g: Z \rightarrow Y$ 为解码映射,则循环一致性要求 $g(f(x)) \approx x$,且 $f$、$g$ 必须在 SLCG 上保持因果机制不变。理论分析表明,该约束显著提升了映射的可逆性和机制不变性。\
我们在多个理解、生成和组合泛化任务上进行广泛实验。结果显示,C3‑UniMM 在准确率、BLEU 等指标上均显著超越现有统一多模态基线,尤其在跨模态组合推理场景中表现出更强的鲁棒性。\
点评:C3‑UniMM 通过显式因果结构和统一解码空间,成功弥补了传统多模态模型的结构缺失问题,为实现真正的跨模态因果推理提供了可行路径。