在人工智能基准测试中,越来越多地采用项目级统计模型,尤其是项目反应理论(IRT),用于估计模型能力、排名系统、选择信息性示例以及诊断基准质量。然而,AI基准数据通常与人类测试的数据模式相悖,后者是标准IRT估计工具最初开发的基础:基准测试通常涉及较少的被评估模型、更多的项目,以及可能存在偏斜、聚集或多模态的能力分布。\n\n我们研究了这些模式不匹配如何挑战IRT建模在AI评估中的可靠性。通过使用来自六个广泛使用的LLM基准的项目参数和能力分布,我们在三种常见的IRT模型下模拟了响应矩阵,并比较了最近基准研究中使用的四种估计工具:边际最大似然、马尔可夫链蒙特卡洛、变分推断和神经伪西米尔估计器。\n\n在18,000个模拟条件下,我们系统评估了计算可行性、可扩展性,以及IRT对模型排名、预测性能和项目特征的推断可靠性。结果表明,在大型基准设置中,经典估计器可能变得不可行,而可扩展估计器在小型或非正态分布的模型集上可能产生不可靠的项目级和排名推断。本研究确定了潜在特质模型在何种情况下可靠支持或可能扭曲AI基准声明,以及进行可信使用所需的样本大小和诊断方法。\n\n博主点评: 本文深入探讨了项目反应理论在AI评估中的适用性,揭示了数据模式不匹配的潜在风险。对比不同估计工具的表现,为研究者选择合适的方法提供了重要参考,尤其是在面对复杂数据分布时。对AI基准测试的可靠性提出了严肃的挑战,值得关注。