协同感知通过多智能体共享感知信息提升环境理解,但在实际部署中常面临传感器模态和模型结构的异构性。传统的两阶段协议方法将不同模态特征映射到统一的协议空间,然而各模态的转换器独立训练会产生模态特定的伪协议分布,导致语义不一致并在误差上叠加,尤其在模态差异巨大的场景中表现突出。
为此我们提出 CauseCollab,一种因果统一且模态无关的网络。它从因果视角在协议空间进行表征学习,利用因果度量学习将语义因素 $S$ 与模态特定的统计混淆因子 $C$ 明确解耦,优化目标可表示为 $$\mathcal{L}=\mathcal{L}_{task}+\lambda\,\mathcal{L}_{causal},\quad \mathcal{L}_{causal}=\|\mathbf{E}[S|C]-\mathbf{E}[S]\|^{2}.$$
网络采用上下文引导的统一转换器(Unified Converter),在保持跨模态语义一致性的同时,仅需为新模态训练少量参数的适配器即可接入系统。
在 OPV2V 与 DAIR‑V2X 两大公开数据集上,CauseCollab 获得了最新的性能记录,尤其在模态差距大的子场景中提升更为显著。
点评