NeFut Logo NeFut
EN 管理员登录

[AI学术] 可解释设计的音频深伪检测:基于维纳-霍普线性预测的创新框架

发布于:2026-07-16 22:00 最后更新:2026-07-17 08:45
#AI #Machine Learning #Audio

随着合成语音生成技术的迅速发展,音频深伪检测已成为多媒体取证中的一项关键挑战。尽管近期一些方法在检测准确性上取得了显著成果,但它们通常依赖于黑箱架构,导致可解释性差且计算复杂度高。

本文提出了一种基于维纳-霍普线性预测的可解释音频深伪检测框架,结合轻量级的二维卷积神经网络(CNN)。该设计使分类结果与信号的声学特性之间建立了直接透明的联系。

实验结果表明,该方法在基准数据集上的检测性能具有竞争力,同时相比于最先进的解决方案,计算复杂度显著降低。

通过Grad-CAM进行的可解释性分析显示,分类器关注于低阶预测系数以及静音和过渡区域,这表明维纳-霍普预测器能够捕捉混响特征和合成语音中的细微统计不一致性。

最后,稳健性实验表明,微调能够有效恢复在常见后处理降质(如添加噪声、MP3压缩和电话滤波)下的检测性能。

博主点评: 本文所提出的框架在可解释性与高效性之间找到了良好的平衡,尤其是在音频深伪检测领域,具有重要的应用价值。维纳-霍普线性预测的使用为检测提供了新的视角,值得在更广泛的语音合成场景中进行探索。

原文链接: https://arxiv.org/abs/2607.12584

[h] 返回首页