背景
对话语音合成(CSS)旨在生成具有类人情感表达和上下文一致性的语音,以提升用户与代理的互动体验。然而,现有的CSS方法由于预定义情感标签空间有限(例如,七种情感类别),难以真实地呈现人类情感。此外,多轮对话历史中冗余的多模态标记也干扰了上下文理解。
AuEmoChat框架
为了解决这些问题,我们提出了AuEmoChat,这是一个用于真实情感理解和渲染的CSS框架。
AuEmoCodec
首先,我们开发了AuEmoCodec,它通过有限标量量化从大规模情感语音中学习离散的真实情感标记空间。这一方法使得情感表现比有限的基本情感类别更加真实。
AuEmoToMe算法
接着,我们提出了AuEmoToMe,一个基于真实情感的标记合并算法,它在合并多模态对话历史中的冗余标记时,能够保留情感相关的上下文。该算法被集成进自回归文本-语音模型中,以预测目标真实情感标记和语音标记。
真实情感流匹配
最后,我们提出了真实情感流匹配方法,通过联合条件合并的对话上下文、目标真实情感和声学先验来渲染语音。
实验结果
在NCSSD-EmCap数据集上的大量实验表明,AuEmoChat在性能上超越了现有的CSS基准,并生成了更具表现力和真实感的情感语音。
博主点评: AuEmoChat通过引入真实情感标记和高效的上下文合并算法,显著提升了对话语音合成的情感表达能力,为人机交互带来了新的可能性,值得关注其在实际应用中的潜力。