随着大规模语音数据的广泛使用,隐私保护成为关键挑战。现有匿名化方法往往破坏声学连续性或削弱声纹多样性,导致下游任务(如自动语音识别、文本到语音、情感识别)的性能下降。为兼顾隐私与实用性,我们提出了两阶段框架。第一阶段使用生成式语音编辑模型对个人可识别信息(PII)进行无缝替换,实现内容隐私保护;第二阶段引入 F3-VA——基于流匹配的匿名化系统,采用三阶段设计生成多样且可区分的匿名说话人,以实现声纹隐私。评估方面,除了传统的声学和内容说话人验证指标外,我们还从零开始训练 ASR、TTS、SER 模型,以全面衡量实用性。实验表明,相比 VoicePrivacy Challenge 基线,我们的方案在隐私保护上更强,且对下游任务的影响极小,新的评估协议也更真实地反映了匿名语音的实用价值。
点评:该工作通过生成式编辑和流匹配双重手段,实现了语音内容与声纹的同步匿名化,并通过从头训练下游模型提供了更完整的实用性评估,为语音隐私保护提供了可行的新路径。