NeFut Logo NeFut
EN 管理员登录

[AI学术] 先听后说:基于听者面部反应的对话语音生成响应规划

发布于:2026-09-21 22:00 最后更新:2026-09-22 02:29
#AI #Machine Learning #Neural

我们提出了 ReACT‑TTS,一个两阶段的对话语音生成框架。第一阶段利用听者在说话前 1 秒的面部表情序列,预测下一句的情感倾向和韵律特征;第二阶段将预测的情感/韵律信息注入到 Grad‑TTS 主干,实现端到端的语音合成。

在严格的二人对话 MELD 协议上,加入时间条件的模型在十个随机种子下的宏观 F1 和 VAD 一致性均显著高于仅使用文本的基线,而整体准确率几乎不变。消融实验表明,时间建模在所有视觉变体中表现最佳,且不需要显式的早‑晚差异;正确的听者反应也优于循环不匹配的情况。

一次面向 20 位语音研究者的适配性调查显示,76% 的受访者更倾向于时间条件模型,9% 仍偏好文本模型,剩余 15% 无明显偏好。

代码已开源于 https://github.com/CYJ1/ReACT-TTS_public

点评:实验结果表明,听者的即时面部动态可以作为对话响应规划的有益补充,为情感感知 TTS 提供了新的视觉线索。

原文链接: https://arxiv.org/abs/2609.21683

[h] 返回首页