NeFut Logo NeFut
EN 管理员登录

[AI学术] 我们对大语言模型的期待是什么?LLM 基准设计映射

发布于:2026-09-18 22:00 最后更新:2026-09-20 12:54
#Machine Learning #LLM #Artificial Intelligence

本文系统性地梳理了2022年1月至2026年8月 arXiv 上 14,767 篇提出或更新评估资源的论文,揭示了大语言模型(LLM)基准设计的演变。通过分阶段筛选和全文自动编码,分析了目标系统与领域、评估材料与条件、评分机制的变化。结果显示,评估重点从纯文本理解逐步转向动作、交互和专业应用;传统指标(如准确率)与新兴指标(如可操作性、用户满意度)并存。模型参与方式也出现不均衡:在代理和非代理两类基准中,基于 LLM 的评分比例上升,而模型生成的测试材料并未出现持续增长。文章进一步讨论了随着 AI 参与测试构建、任务执行和结果判定,评估是否提供更独立的证据,还是会复制模型自身的偏好和盲点。

点评

原文链接: https://arxiv.org/abs/2609.19182

[h] 返回首页