NeFut Logo NeFut
EN 管理员登录

[AI学术] 颠覆性理论:延迟-响应模型评估大型语言模型的准确性与推理深度

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#AI #Machine Learning #optimization

摘要

大型语言模型(LLMs)的快速发展需要有效的评估方法,以指导下游应用和未来的改进。项目反应理论(IRT)模型结合计算机自适应测试,成为评估LLMs响应准确性的新兴框架。除了简单的响应准确性外,LLMs的思维链(CoT)长度也是其推理能力的重要指标。

为充分利用CoT长度信息,我们提出了延迟-响应理论(LaRT)模型,该模型通过引入潜在能力与潜在速度之间的关键相关参数,联合建模响应准确性和CoT长度。

我们推导出了一种高效的随机近似期望最大化算法,用于参数估计。同时,我们建立了潜在能力和潜在速度参数的严格可识别性结果,以确保其估计的统计有效性。

通过理论渐近分析和仿真研究,我们展示了LaRT在估计准确性和潜在特征估计的置信区间短度方面相较于IRT的优势。

为在实际数据中评估LaRT,我们收集了多个LLMs在流行基准数据集上的响应。研究发现,LaRT与IRT的LLM排名不同,并且在预测能力、项目效率、排名有效性和LLM评估效率等多个关键评估指标上优于IRT。代码和数据可在 GitHub 找到。

博主点评: LaRT模型通过引入潜在速度参数,创新性地将响应准确性与推理深度结合,为LLMs的评估提供了更全面的视角。这一方法不仅提升了评估的准确性,也为未来的模型改进提供了重要指导,值得研究者深入探索。

原文链接: https://arxiv.org/abs/2512.07019

[h] 返回首页