Voice agents 在真实业务中必须同时处理多个请求、背景噪音以及失去耐心的用户。我们推出 VAmoS Energy 基准,将这些难点融合在 100 通关于公共事业账单和付款帮助的通话中。每位来电者会提出两到四个请求,代理拥有十六个工具,背后由带状态的 Stripe 账单镜像和 Apache Fineract 贷款引擎支撑,账户访问在来电者验证成功前被阻断。任务使用公开的家庭用电数据,并依据宾夕法尼亚州住宅计费规则制定政策。一个 LLM‑as‑verifier 会检查代理的操作和口头数字是否符合明确要求。校准实验中,它与代码验证器在 99.1% 的检查上达成一致。
在十四种语音栈上进行三次重复实验,任务完成率在 17.3% 到 44.7% 之间。Grok Voice 表现最佳,Gemini 3.8 Live 与 GPT‑Live 的每通成本相近。背景电视噪音将整体完成率从 38.7% 降至 8.6%。模拟来电者往往会接受错误结果,因为只能听到代理的话语,却无法检查其实际操作。
这些结果表明,语音代理的评估必须覆盖整段通话,包括说了什么、改动了什么以及如何处理竞争性语音。
点评