我们推出了 Echoes,这是一个旨在训练和评估音乐深度伪造检测器的新数据集,适用于现实和多样化的提供者条件。Echoes 包含 4,468 首曲目(总计 131 小时音频),涵盖多种音乐风格(流行、摇滚、电子),并包含由十种流行的 AI 音乐生成系统生成的内容。
为了防止捷径学习并促进稳健的泛化,数据集的构建故意具有挑战性,强制在伪造音频和真实参考之间实现语义级对齐。这种对齐是通过直接基于真实波形或歌曲描述符对生成的音频样本进行条件化来实现的。
我们在交叉数据集设置中对 Echoes 进行评估,与三种现有的 AI 生成音乐数据集进行比较,使用了最先进的 Wav2Vec2 XLS-R 2B 表示。结果显示:(i)Echoes 是最困难的领域内数据集;(ii)在现有数据集上训练的检测器在 Echoes 上迁移效果较差;(iii)在 Echoes 上训练可获得最强的泛化性能。
这些发现表明,提供者多样性和语义对齐有助于学习更具可迁移性的检测线索。
博主点评: Echoes 数据集的推出为音乐深度伪造检测提供了新的视角,其强调的语义对齐和挑战性构造,将推动该领域的研究进展,特别是在提高检测器的泛化能力方面。