当前的语音AI基准通常只评估孤立的能力,如语音可懂度、单词错误率或基于文本的对话质量,但很少测试系统是否利用了区分口语与文本表示的声学信息。为此,我们推出了真实世界语音EQ基准,这是一个多维度的基准,用于评估语音AI在文本转语音(TTS)、语音转语音(STS)、语音理解(SU)和自动语音识别(ASR)方面的表现。
我们的评估表明,性能在不同维度上存在显著差异。在TTS方面,自然度、表现力、身份稳定性和可靠性是相对独立的评估维度。在STS中,访问音频并不保证利用声调效果,有些代理仍然主要依赖文本转录。在SU中,模型在副语言任务上的表现参差不齐。在ASR中,现实世界的口音、情感、噪声和对话条件暴露出未被现有清晰语音基准捕捉到的失败。
综合这些结果,表明语音AI应该作为声学、表现、交互和鲁棒性能力的综合体进行评估,而不是仅仅通过单一的综合得分来衡量。
博主点评: 该研究提出的RW-Voice-EQ基准为评估语音AI提供了更全面的视角,强调了多维度评价的重要性,未来的研究应关注如何在复杂环境中提高语音AI的表现。