NeFut Logo NeFut
EN 管理员登录

[AI学术] MTVA-Bench:评估级联语音代理中的语言模型

发布于:2026-09-18 22:00 最后更新:2026-09-20 12:54
#Machine Learning #LLM #Artificial Intelligence

大多数语音代理采用级联架构:ASR 将来电音频转写为文本,语言模型读取转写并决定回复内容以及调用哪些后端工具,最后 TTS 将回复合成语音。决策核心全部在语言模型,但现有评估要么覆盖整个流水线,导致识别错误与模型错误混在同一分数;要么只评估语言模型本身,却忽略真实通话中的转写错误、跨消息的说话人分割以及必须遵守的脚本规则。\ \ 我们提出 Multi‑Turn Voice Agent Benchmark(MTVA‑Bench),在语言模型实际面对的级联环境中进行评估。来电者由遵循评分细则的 LLM 扮演,工具调用则由模拟后端根据模型实际发送的参数作出响应。基准包含 49 种代理,覆盖 490 条经过审查的场景,并支持 7 种语言。\ \ 评分由两部分组成:一是对工具调用进行确定性检查,二是使用两位 LLM 评审。第一位评审依据场景规则打分,第二位评审在不知任务细节的情况下评估对话质量。两位评审必须引用对话记录中的具体消息。任务得分与对话得分等权加权,因为即使任务完成,若对话体验差也算失败。\ \ 在对七个模型的实验中,六个模型在正确选择工具的表现相差仅 6.4 分,但整体得分跨度达 24.4 分。分差主要来源于参数取值、动作顺序、规则遵守以及模型在调用工具前后的语言表达。\ \ 点评

原文链接: https://arxiv.org/abs/2609.20152

[h] 返回首页