摘要
自回归文本到语音(TTS)模型虽然在自然性上表现优异,但由于逐步生成令牌导致推理速度缓慢,这限制了其在需要低延迟的生产应用中的部署。IndexTTS-2 是一种最先进的自回归 TTS 模型,由 GPT、流匹配扩散变换器和声码器组成。尽管其合成质量高,但在没有流式或批处理支持的情况下,其推理速度几乎无法达到实时。
我们提出了 Faster IndexTTS-2,通过使用 NVIDIA TensorRT 和 TensorRT-LLM 加速 IndexTTS-2 的所有神经网络组件,以便在 GPU 上进行生产部署。Faster IndexTTS-2 还支持流式合成,适用于对延迟敏感的交互式应用,并在所有组件之间实现批量推理,以最大化 GPU 利用率。我们在 Seed-TTS 基准上进行的实验表明,英文和中文的自回归 GPT 速度提高了 5.0$\times$,端到端速度提高了 3.6$\times$,同时在词错误率、说话人相似性和自然性方面的降级极小。我们的方法为在 GPU 上高效加速类似的自回归语音模型提供了实用参考。
博主点评: Faster IndexTTS-2 在保持音质的同时显著提升了推理速度,展示了在 GPU 上优化自回归模型的巨大潜力。这不仅有助于提升用户体验,也为未来的实时语音合成应用奠定了基础。