摘要
近年来,文本到语音和语音克隆技术的进步,使得高质量的伪造变得廉价且可扩展,这对语音认证系统,尤其是自动说话人验证(ASV)构成了威胁。现有的防御机制主要通过深度伪造检测的二元对策(CMs)或伪造感知说话人验证(SASV)来应对这一威胁,目前的系统主要采用模块化的ASV-CM融合与级联管道。
尽管大型音频语言模型(LALMs)在相关音频任务(如CM和ASV)中展现了潜力,但在SASV中的应用仍未被探索,尽管它们具备生成自然语言理由以增强审核和稳健性的能力。
本研究系统性地评估了LALMs在SASV中的表现,与传统管道进行对比,采用零样本提示、监督适应、推理导向训练和基于强化学习的优化。我们的结果表明,在零样本设置中,预训练的LALMs表现接近随机水平,确认它们并不适合SASV,但通过特定任务的适应可以缩小这一差距。
我们进一步发现,通过多种不同的路径可以实现具有竞争力的SASV性能。这些发现将LALMs定位为统一SASV的有前景且可审核的基础,同时阐明了传统级联系统的优势所在。
博主点评: 本研究展示了大型音频语言模型在伪造感知说话人验证中的潜力,强调了任务适应的重要性。未来的研究应进一步探索如何优化这些模型以提升其在安全认证中的应用价值。