NeFut Logo NeFut
Admin Login

[CS.AI] Exploring Diffusion Transformers for Cross-Modal Augmentation in Multimodal Brain State Decoding

Published at: 2026-09-12 22:00 Last updated: 2026-09-15 01:15
#Machine Learning #Neural #Artificial Intelligence

Multimodal brain‑state decoding has mostly focused on directly fusing paired modalities for prediction, while rarely exploiting their correspondence to enrich training samples and improve representation learning. To bridge this gap, we introduce CoMA‑DiT, a bidirectional cross‑modal Diffusion Transformer for latent‑space augmentation. CoMA‑DiT treats paired modalities as mutual generative supervisors, conditions velocity prediction on the other modality via cross‑modal attention, and injects the resulting variation through a reliability‑gated residual mechanism.

On multimodal auditory‑attention decoding and emotion‑recognition tasks, CoMA‑DiT consistently outperforms 20 representative baselines. Compared with a no‑augmentation baseline, it gains 4.28% in accuracy and 6.70% in macro‑F1. Extensive ablation, sensitivity, visualization, and interpretability studies demonstrate its robustness, generalizability, and ability to capture functionally relevant cross‑modal interactions.

These findings endorse a broader view of multimodal learning: paired modalities serve not only as fusion inputs but also as supervisory sources that mutually augment each other. Review

Original Source: https://arxiv.org/abs/2609.11341

[h] Back to Home