大型语言模型(LLM)计算使用代理通常在干净的书面指令下评估,而语音正成为与这些系统交互的主流方式。语音输入会引入转录错误,这些错误可能在代理开始推理前改变任务关键实体、约束或目标,而传统的ASR指标并未直接衡量执行所需信息是否被保留。
我们提出 Talk2Agent 基准,用于评估语音接口将人类口述指令传递给基于 LLM 的计算使用代理的效果。该基准将 WildClawBench 和 OSWorld 中的任务转化为口述版本,并测试多种语音接口,包括专用 ASR 模型、具备音频能力的 LLM、上下文偏置以及基于 LLM 的本体修复。
由于重复执行长时程计算任务成本高且具有随机性,我们进一步提出一种无执行、任务条件化的评估框架。该框架将原始任务评分器投射到可通过提示访问的意图上,量化语音接口在传递任务相关信息方面的保留程度。在 WildClawBench 上,Talk2Agent 的无执行原生投射提供了实用且与执行挂钩的语音接口质量度量,其与下游任务完成度的皮尔逊相关性比传统的 WER/CER 提高了 0.246,基于 32 小时真实人声数据。
点评