基准分数正日益左右大语言模型(LLM)的研发、营销和选型。但整体分数的意义只能在特定系统、所含问题以及评估条件的框架下解释。本文指出通用LLM排名的五大关联局限:评测系统与公开可得系统不一致、外部评测受商业激励与依赖影响、基准饱和、测试缺陷与数据污染、模型利用评分机制作弊、以及通用分数对用户任务的相关性有限。通过案例展示这些问题需要不同的应对措施。我们主张评测过程必须公开测试配置、验证问题与任务完成情况、同时报告性能、成本与执行时间,并明确泛化范围。随后介绍 Isotanta——一个众包基准平台,展示了贡献问题和重复评估的实践。更大的题库有助于提升任务覆盖面,重复抽样可提升对该题库的估计稳定性,但仍不能保证有效性或个性化。平台当前的共享排名与我们提出的任务特定和用户自定义评估之间存在区别。核心论点是,模型选型应基于对目标工作表现的证据,而非仅凭通用排行榜的高位。
点评