摘要
直接从头皮脑电图(EEG)解码语音信息为文本,为严重言语和运动障碍的个体提供了一种潜在的非侵入性神经通信通道。与侵入性的方法如皮层电图相比,EEG更安全且更易于部署,但解码难度显著增加。对于中文句子的解码,这一挑战更加严峻,因为需要处理包含数千个字符的高维输出空间、严重的个体间差异和低信噪比以实现文本对齐。
现有方法仅依赖于单一的监督轴——要么是文本语义,要么是音频声学特征,但两者都无法同时满足大词汇量中文解码所需的句子级可区分性和细粒度时间分辨率。
我们提出了 EEGAlign,这是一种新颖的参数高效框架,能够将 EEG 与两个轴进行联合对齐——通过对比学习与 BGE-M3 文本嵌入对齐文本,以及通过 wav2vec~2.0 语音特征对齐音频,随后进行 CTC 字符序列解码。在 ChineseEEG-2 数据集上,EEGAlign 达到了最先进的闭集句子分类性能,在朗读 EEG 上的 Top-1 准确率达到 82.37%,在被动聆听 EEG 上达到 41.43%,共计 101 个候选句子。消融研究表明,这两个对齐轴是高度互补的:结合它们的性能始终优于单独使用。
据我们所知,这是首次在非侵入性 EEG 下解码大词汇量中文句子,并在相对较大的闭集候选句子设置中实现强分类性能。
博主点评: 该研究展示了 EEG 在语言解码领域的巨大潜力,尤其是在中文这种复杂语言环境下,EEGAlign 的方法通过联合对齐文本和音频特征,显著提升了解码精度,为未来的非侵入性沟通技术奠定了基础。此项工作将为需要辅助沟通的个体带来希望,值得关注和进一步探索。