唤醒词检测是虚拟助理的关键入口,决定用户交互的流畅度。本文提出一种在传统直接关键词检测之上加入上下文触发检测的唤醒系统。系统在检测到唤醒词后,会通过推理模块判断后续语音是用户指令还是无关谈话,从而实现高效且具上下文感知的交互。为训练该模型,作者构建了可控的多说话人合成对话生成框架,生成了62.3 小时的语料库,涵盖直接调用、上下文跟进以及未被唤醒的闲聊。实验在多种合成对话场景下验证了方法的有效性。代码、数据集和训练好的模型已公开,以促进可复现研究和助理技术的进一步发展。点评
唤醒词检测是虚拟助理的关键入口,决定用户交互的流畅度。本文提出一种在传统直接关键词检测之上加入上下文触发检测的唤醒系统。系统在检测到唤醒词后,会通过推理模块判断后续语音是用户指令还是无关谈话,从而实现高效且具上下文感知的交互。为训练该模型,作者构建了可控的多说话人合成对话生成框架,生成了62.3 小时的语料库,涵盖直接调用、上下文跟进以及未被唤醒的闲聊。实验在多种合成对话场景下验证了方法的有效性。代码、数据集和训练好的模型已公开,以促进可复现研究和助理技术的进一步发展。点评