摘要
本文提出了一种声音匿名化模型,重点在于保留内容而非生成逼真的语音。该模型依赖于从冻结的预训练 wav2vec2 编码器中提取的内容嵌入,这些嵌入通过向量量化和 HiFi-GAN 声码器解码为匿名信号,训练过程中不涉及波形重建损失或说话人嵌入映射。
训练目标确保匿名信号的嵌入与原始信号的嵌入匹配。在训练过程中,使用带有梯度反转层的辅助说话人分类分支来丢弃说话人特定信息。结果显示,这种简单的基于嵌入的方法实现了非常低的词错误率(WER 2.53),匿名化性能(EER 13.39)在 VPC 的第一层级中排名。
值得注意的是,即使没有支持的训练目标,情感部分得以保留(UAR 43.91),且匿名语音在没有重建损失的情况下仍然清晰可听。
博主点评: 该研究通过创新的声学处理方法,成功实现了高效的声音匿名化,展示了内容嵌入在语音处理中的潜力。尤其值得关注的是,情感信息的保留为应用场景提供了更多可能性,未来的发展将有助于提高语音隐私保护的有效性。