听觉注意力解码(AAD)通过生理信号识别用户关注的说话者,为神经驱动的助听设备和自然的人机交互提供支持。EEG 是 AAD 的主要模态,但在自然音视频场景中只能提供有限信息,因而需要与 EOG 融合。现有方法普遍存在跨模态交互弱、时间建模效率低以及对样本变化鲁棒性差等问题。\ \ 为克服这些不足,本文提出 RAMamba-Net——一种可靠性感知的基于 Mamba 的多模态融合网络。网络核心包括:\
- Mamba 增强的带感知卷积 Transformer,用于捕获不同频段的 EEG 特征并建模长程时间依赖;\
- 双分支时空编码器,分别处理 EOG 的时间序列和通道间空间关系;\
- 跨模态注意力机制,实现显式的模态交互;\
- 可靠性感知模块,根据每个样本估计 EEG 与 EOG 的权重,以保证特征和预测的一致性,从而提升融合效果。\ \ 在两个公开的 AAD 基准上实验表明,RAMamba-Net 能够充分利用 EEG‑EOG 的互补信息,较单模态基线提升 5.76% 的准确率,并显著增强了解码的稳健性和特征的判别性。进一步分析显示,跨模态注意力提升了模态对齐程度,而可靠性感知模块能够抑制不可靠的模态证据,对信号扰动和参数变化保持鲁棒。\ \ 点评