实时语音代理已经从研究原型进入生产部署,但相关文献分散在语音基础建模、轮转心理语言学和代理评估三个社区,彼此很少引用。架构论文报告延迟,轮转论文报告预测准确率,代理基准报告任务成功率,单一指标难以判断部署的代理是否优秀。我们基于38篇主要文献构建了六类应用导向的分类体系,提出三条证据支撑的结论。第一,架构选择是部署约束而非最终结论:2026年的企业教程指出尚无完全自托管的端到端系统满足生产要求,而分块级联方式独立实现了最先进的双工行为,说明双工行为可与双工架构解耦。第二,评估已从组件质量转向落地结果,最新基准通过验证后端状态而非仅信任代理的声明来衡量。第三,传统的二元假设正在失效:多方轮转和多说话人推理基准表明,何时保持沉默以及推断信息应向谁传递是必须的能力,二人框架无法捕获。对于每篇文献我们列出其针对的问题、机制、报告的证据,并说明检索策略、纳入标准以及一次发现的错误 arXiv 标识符。我们提出 TRG(Timing‑Recovery‑Grounded)报告标准,用时序、扰动后恢复和状态验证结果三维描述代理,并在多方部署时加入可选的第四维。
点评