摘要
自动语音识别(ASR)目前主要依赖自回归解码器逐个发出标记。本文探讨了是否可以利用离散扩散语言模型来转录语音,通过少量去噪步骤并行优化整个转录。我们为DiffusionGemma训练了一个音频原生接口,该模型为一个包含260亿参数的混合专家模型,通过均匀随机标记的离散扩散生成文本,而非近年来扩散语言模型常用的吸收掩码方案。
冻结的Whisper编码器提供声学特征,轻量级投影器将其映射到模型嵌入空间,低秩适配器使冻结的主干能够关注新模态。大约4200万个参数被训练,这仅占主干的0.16%。我们发现,自然训练目标未能有效地将音频与文本对齐,因为其梯度仅通过已经忽视它的注意力到达投影器。通过冻结的输出头施加连接时序分类损失打破了这一僵局。
最终模型在LibriSpeech test-clean上达到了6.6%的字错误率,无论话语长度如何,转录过程大约需要八个并行步骤,且使用一个在六种语言上训练的适配器,我们在英语、印地语和普通话上进行了评估。
博主点评: 本文提出了一种新颖的音频转录方法,利用离散扩散模型的优势,显著提高了语音识别的并行处理能力。这一方法在降低字错误率的同时,展示了在多语言环境中的适应性,具有重要的应用潜力与研究价值。