Voice agents 正在越来越多的业务流程中使用,交互失败会直接影响交易、访问等关键结果。因此,需要一种可复现、可解释的评估方法。我们提出 Inquesto Score(IS),将可靠性定义为在固定、版本化的评估人群中,成功实现呼叫者目标且未出现功能性失效或更严重问题的通话比例。IS 不通过混合异构指标来计算,而是明确列出失效事件及其严重程度,并在部署的语音流水线上直接评估。\ \ 时间类失效(如说话重叠、响应延迟)直接从音频中测量;语义及状态相关失效则通过场景谓词、工具追踪以及固定的开源模型评审器来判定。除了核心分数,协议还提供行为诊断视图、声学鲁棒性、身份处理和说话人群体等维度的报告,但这些不参与分数合成。\ \ Inquesto Score v0.1 包含 30 种场景、3 种声学条件、4 类说话人群体,并在每个代理上执行 306 通通话,覆盖 13 种参考系统配置。实验表明,仅凭转录无法完整衡量可靠性,必须显式考虑部署环境并验证评审器的判定准确性。我们已公开协议、参考实现以及完整评估记录。\ \ 点评