确定两位说话者的口音差异是语言学和语音技术研究的基础任务。度量方法取决于研究方向。语音学家常通过比较单词录音中的元音共振峰来展示口音变化,这种方式易于解释,但采集成本高且难以覆盖连贯语流。相对地,口音文本到语音(TTS)研究倾向使用从口音分类任务中得到的口音嵌入,这类嵌入可从任意语音获得,却缺乏直观解释。本文提出,利用构音逆推得到的构音表征可作为可解释的口音比较基底,并通过最优传输框架实现跨录音类型的口音比较。该方法兼具灵活性和可解释性,为后续的口音分析与合成提供统一工具。
点评
确定两位说话者的口音差异是语言学和语音技术研究的基础任务。度量方法取决于研究方向。语音学家常通过比较单词录音中的元音共振峰来展示口音变化,这种方式易于解释,但采集成本高且难以覆盖连贯语流。相对地,口音文本到语音(TTS)研究倾向使用从口音分类任务中得到的口音嵌入,这类嵌入可从任意语音获得,却缺乏直观解释。本文提出,利用构音逆推得到的构音表征可作为可解释的口音比较基底,并通过最优传输框架实现跨录音类型的口音比较。该方法兼具灵活性和可解释性,为后续的口音分析与合成提供统一工具。
点评