多模态脑状态解码传统上侧重于将配对模态直接融合用于预测,鲜有研究利用它们之间的对应关系来丰富训练样本并提升表征学习。为填补这一空白,本文提出 CoMA‑DiT——一种双向跨模态扩散 Transformer,用于潜在空间的增强。CoMA‑DiT 将配对模态视为相互的生成监督源,通过跨模态注意力将另一模态的信息条件化到速度预测上,并通过可靠性门控残差机制自适应注入生成的变化。
在多模态听觉注意力解码和情感识别两个任务上,CoMA‑DiT 相比 20 种代表性基线始终保持领先。相较于不使用增强的基线,准确率提升 4.28%,宏观 F1 提升 6.70%。进一步的消融、敏感性、可视化和可解释性分析表明模型具备稳健性、可迁移性,并能够捕获功能相关的跨模态交互。
这些结果支持一种更广阔的多模态学习观:配对模态不仅是融合的输入,也可以作为相互监督的来源,实现互补增强。点评