NeFut Logo NeFut
EN 管理员登录

[AI学术] 高效文本转音频生成:通过剪枝提升性能

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:19
#optimization #Neural #DeepSeek

在基于扩散的文本转音频生成模型中,如 AudioLDM,虽然其感知质量和语义一致性极高,但由于 U-Net 去噪骨架的计算开销,实际部署受到限制。本研究通过模型剪枝来提升 AudioLDM 的计算效率,该模型是一个基于 U-Net 的文本条件音频潜在扩散模型。

我们分析了 U-Net 卷积块中的参数冗余,并评估了一种滤波器剪枝策略。剪枝是基于范数标准进行的,随后进行轻量级微调以恢复性能损失。实验结果表明,U-Net 的参数减少了多达 83%,乘加操作减少了 39%,而生成质量在某些情况下得到了保持或改善,较未剪枝网络的基线相比。

我们发现,剪枝对 AudioLDM 生成某些声音事件的能力产生了影响,包括安全关键的声音(如枪声、警报声和爆炸声)、机械声(如钻机和缝纫机声),以及其他声音(如喷雾声和滴答声),这些大多数声音可以通过对剪枝模型进行轻量级微调来恢复。

原文链接: https://arxiv.org/abs/2607.13330

[h] 返回首页