NeFut Logo NeFut
EN 管理员登录

[AI学术] Talk2Agent:评估语音接口在文本代理中的表现

发布于:2026-10-01 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

大型语言模型(LLM)计算使用代理通常在干净的书面指令下评估,而语音正成为与这些系统交互的主流方式。语音输入会引入转录错误,这些错误可能在代理开始推理前改变任务关键实体、约束或目标,而传统的ASR指标并未直接衡量执行所需信息是否被保留。

我们提出 Talk2Agent 基准,用于评估语音接口将人类口述指令传递给基于 LLM 的计算使用代理的效果。该基准将 WildClawBench 和 OSWorld 中的任务转化为口述版本,并测试多种语音接口,包括专用 ASR 模型、具备音频能力的 LLM、上下文偏置以及基于 LLM 的本体修复。

由于重复执行长时程计算任务成本高且具有随机性,我们进一步提出一种无执行、任务条件化的评估框架。该框架将原始任务评分器投射到可通过提示访问的意图上,量化语音接口在传递任务相关信息方面的保留程度。在 WildClawBench 上,Talk2Agent 的无执行原生投射提供了实用且与执行挂钩的语音接口质量度量,其与下游任务完成度的皮尔逊相关性比传统的 WER/CER 提高了 0.246,基于 32 小时真实人声数据。

点评

原文链接: https://arxiv.org/abs/2609.38867

[h] 返回首页