NeFut Logo NeFut
EN 管理员登录

[AI学术] 生产环境高效基准测试:LLM 代理的演进研究

发布于:2026-09-21 22:00 最后更新:2026-09-22 02:29
#Machine Learning #optimization #LLM

在生产环境中,LLM 代理会随着功能迭代而频繁评估,但完整的基准测试成本高昂。本文基于一个月活用户数达数万的分析代理,回顾了 574 次历史基准运行,并将其按时间顺序划分为校准期和留出期,比较了四种重复评估策略:随机抽样、历史缓存、固定代表子集以及基于项目反应理论(IRT)的自适应测试。实验表明,多维 2PL 自适应测试在整体得分保真度上表现最佳,仅执行 200 道题目(占完整运行的 38.5%),MAE 仅增加 1.03 个百分点。出于运维简便的考虑,最终在生产中部署了难度分层的固定子集,并验证了该子集无需重新校准即可迁移到另外五类代理,且在校准窗口缩短至一天时仍保持稳定。基于这段部署经验,本文给出以下实用建议:① 采用难度分层的固定子集作为日常监控基准;② 定期使用少量随机抽样或 IRT 自适应测试验证基准的代表性;③ 在出现显著模型更新时,快速重新校准子集以防漂移。

点评

原文链接: https://arxiv.org/abs/2609.21267

[h] 返回首页