在基于扩散的文本转音频生成模型中,如 AudioLDM,虽然其感知质量和语义一致性极高,但由于 U-Net 去噪骨架的计算开销,实际部署受到限制。本研究通过模型剪枝来提升 AudioLDM 的计算效率,该模型是一个基于 U-Net 的文本条件音频潜在扩散模型。
我们分析了 U-Net 卷积块中的参数冗余,并评估了一种滤波器剪枝策略。剪枝是基于范数标准进行的,随后进行轻量级微调以恢复性能损失。实验结果表明,U-Net 的参数减少了多达 83%,乘加操作减少了 39%,而生成质量在某些情况下得到了保持或改善,较未剪枝网络的基线相比。
我们发现,剪枝对 AudioLDM 生成某些声音事件的能力产生了影响,包括安全关键的声音(如枪声、警报声和爆炸声)、机械声(如钻机和缝纫机声),以及其他声音(如喷雾声和滴答声),这些大多数声音可以通过对剪枝模型进行轻量级微调来恢复。