近年来,利用非侵入式脑机接口(BCI)信号对感知语音进行解码已成为热点。该领域主要面临两大难题:一是如何提取兼具丰富时空信息的神经表征,二是如何实现跨受试者的泛化。已有工作往往分别针对其中一项进行优化,却缺乏同时解决两者的统一方案。为此我们提出了主体不变跨模态感知语音解码(SICMD)方法,融合功能性磁共振成像(fMRI)与脑磁图(MEG)数据。我们系统评估了融合策略、融合位置、编码器结构以及模型输入的影响。实验表明,在跨受试者感知语音解码任务中,SICMD 相比基线在 Top‑1、Top‑10 与 Rank‑acc 上分别提升超过 10.6%、10.1% 与 1.7%。与此同时,训练成本相较于多受试者和单受试者设置分别降低 88.8% 与 60.5%。可视化分析进一步验证了模型对跨模态特征的有效捕获。
点评:SICMD 通过深度融合 fMRI 与 MEG,实现了时空信息的互补,显著提升了跨受试者解码性能并大幅削减计算开销,为实际 BCI 应用提供了可行路径。