本文系统性地梳理了2022年1月至2026年8月 arXiv 上 14,767 篇提出或更新评估资源的论文,揭示了大语言模型(LLM)基准设计的演变。通过分阶段筛选和全文自动编码,分析了目标系统与领域、评估材料与条件、评分机制的变化。结果显示,评估重点从纯文本理解逐步转向动作、交互和专业应用;传统指标(如准确率)与新兴指标(如可操作性、用户满意度)并存。模型参与方式也出现不均衡:在代理和非代理两类基准中,基于 LLM 的评分比例上升,而模型生成的测试材料并未出现持续增长。文章进一步讨论了随着 AI 参与测试构建、任务执行和结果判定,评估是否提供更独立的证据,还是会复制模型自身的偏好和盲点。
点评