NeFut Logo NeFut
EN 管理员登录

[AI学术] 细化提升可懂度,搜索提升身份:测试时计算在遮蔽扩散 TTS 中的作用

发布于:2026-10-06 22:00 最后更新:2026-10-08 01:25
#AI #Machine Learning #Neural

本文研究了扩散语言模型在文本到语音(TTS)任务中的两类计算资源:模型深度(参数量)和推理时的细化步数(计算预算)。我们训练了 15 种不同深度(19‑133M 参数,3 个随机种子)的遮蔽扩散编解码器 TTS 模型,使用 2000 小时的语音数据,并在推理阶段对细化步数 $T$ 在 $[1,16]$ 范围内进行遍历。评估指标包括零样本合成的 ASR 词错误率(衡量可懂度)和说话人验证准确率(衡量身份保持),在 174 位未见说话人上进行测试。

结果显示,细化步数能够关闭可懂度误差范围的 86.2%,但仅能关闭身份误差范围的 46.4%,形成约 1.86 倍的非对称性,这一现象在多种误差度量下均保持稳健。进一步在相同数据上以 3 倍和 6 倍的训练调度重新训练模型,非对称性略有减小(从 1.84 降至 1.36 再到 1.23),但仍未消除,因为可懂度随步数趋于饱和,而身份仍在持续提升。

我们还引入了 Best‑of‑K 搜索策略,在细化无法恢复说话人身份时,通过对四个独立编码器的多样化采样实现 64.6%‑79.0% 的胜率。模型深度 $d$ 与细化步数 $T$ 并非可互换的资源;分离的 $B(d)B(T)$ 形式在 AICc 上显著优于替代模型(ΔAICc=+69.3),表明两者针对不同瓶颈。进一步分析发现,剩余身份缺口的 62% 来源于编解码器本身,而非生成器。

结论是,细化主要缓解可懂度瓶颈,模型深度主要提升身份保持,两者应分别优化而非相互替代。

点评:细化步数在提升语音清晰度方面效果显著,但对说话人身份的恢复有限;搜索策略可以弥补这一不足。未来工作应在编解码器设计上投入更多算力,以同步提升可懂度和身份一致性。

原文链接: https://arxiv.org/abs/2610.03320

[h] 返回首页