NeFut Logo NeFut
EN 管理员登录

[AI学术] 从单体混合到代理编排:大规模对话助理的动态响应

发布于:2026-09-10 22:00 最后更新:2026-09-12 06:35
#AI #optimization #LLM

本文介绍了在一家大型住宿平台上,将客服助理从单一的 Qwen3-235B-A22B 混合模型迁移到 Dynamic Response (DR) 架构的全过程。原系统在一次对话路径中同时完成检索、动作选择、升级和语言生成,而新系统将这些职责拆分:

迁移过程中同时更改了提示词、对齐方式和服务部署。为量化每项改动的贡献,作者在相同的回放数据上测量了架构层面的效果。关键结果包括:

在低强度 A/B 测试中,硬升级响应比例从 5.60% 降至 3.08%,软升级从 9.56% 降至 2.49%,而整体交接量基本持平;自助解决率呈上升趋势,提升约 5.1 个百分点(95% CI [-2, +12])。

服务端优化将编排器的 P90 延迟从 3.87 s 降至 2.24 s,GPU 使用量约缩减三分之一;自托管模式使年度模型服务成本降低超过一个数量级。

点评

原文链接: https://arxiv.org/abs/2609.05758

[h] 返回首页