NeFut Logo NeFut
EN 管理员登录

[AI学术] 多维评估新纪元:可扩展的对话代理评估管道

发布于:2026-07-15 22:00 最后更新:2026-07-17 08:46
#AI #Machine Learning #Open Source

摘要

评估零售对话代理需要超越词汇重叠指标的方法,以评估意图一致性、事实性、帮助性、清晰度、语气及整体响应质量。尽管 LLM 作为评判者的方法提供了可扩展的人类评估替代方案,但在生产部署中引入了治理、可重复性、成本、模式一致性、可追溯性和可靠性等挑战。

我们提出了 GenAI Evaluation,这是一个受治理、基于配置的管道,用于大规模评估零售对话系统。该框架通过规范化、分片、异步执行和模式约束的 LLM 评分处理生产聊天机器人日志。它评估帮助性、真实性、清晰度、语气一致性和特定翻译维度。选择性重评仅处理不完整、格式错误或模式无效的记录,同时模式锁定、版本化配置、验证日志和记录级来源支持审计能力。

该框架每日处理约 50,000 条记录,已评估超过 200 万次交互。验证使用了来自四名训练过的注释者的 12,980 条分层随机人类标注记录。分类涵盖了 14 个意图、156 个子意图、18 个主要领域和 129 个子领域。该管道实现了 0.93 的宏 F1 分数和 89% 的人类接受度准确率。

博主点评: 这项研究展示了如何在大规模生产环境中有效评估对话代理,解决了传统评估方法的诸多局限性。GenAI Evaluation 的设计不仅保证了评估的全面性,还确保了治理和可追溯性,为零售行业的智能对话系统提供了强有力的工具。其高达 89% 的人类接受度准确率,表明该方法在实际应用中的有效性和可靠性。

原文链接: https://arxiv.org/abs/2607.12085

[h] 返回首页