NeFut Logo NeFut
EN 管理员登录

[AI学术] τ-抽取:语音代理多轮实体提取基准

发布于:2026-09-15 22:00 最后更新:2026-09-16 00:22
#algorithm #AI #Machine Learning

语音代理在收集姓名、地址、标识符、日期和时间等信息时,需要做到精确无误,但现有的端到端基准往往掩盖了失败的具体环节。为此我们推出了 $\tau$-Elicitation 基准,包含 200 条任务,覆盖 10 种实体类型,提供可控难度、来电真实感以及三种实验环境。与文本代理匹配的模型能够全部通过,而四种语音配置的鲁棒精确成功率仅在 0.14 到 0.41 之间。系统会对难度较高或不熟悉的实体增加验证步骤,有时也会对错误捕获进行验证,但在最弱的来电语音下并未提升验证率;已验证错误中只有 24% 到 37% 能被修正。引入一个包括拼写、复读、纠正和确认的脚手架,可将鲁棒 Pass$^3$ 提升 14 到 31 分,代价是每通电话额外耗时 21 到 28 秒。拼写变体和通话重启等真实感因素对精确成功率影响不大,而发音错误会显著增加修复工作量。整体结果表明,策略选择和成功恢复是实现精确语音实体收集的关键瓶颈。

点评:该基准为评估语音系统的细粒度表现提供了可操作的实验平台,揭示了验证与纠错机制在实际对话中的重要性。

原文链接: https://arxiv.org/abs/2609.13602

[h] 返回首页