NeFut Logo NeFut
EN 管理员登录

[AI学术] 语言模型经济评估:开创高效评测的新纪元

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #Open Source

摘要

语言模型在经济上具有重要价值,但目前尚未对其在每项经济价值任务上的表现进行评估。我们推出了 EconEvals,一个开源评估套件,用于衡量与美国劳动经济中的任务、工作活动和职业相关的能力。这个评估套件尽可能基于真实用户查询,并补充了合成数据。

我们的评估覆盖范围优于 OpenAI 的 GDPval 基准,后者仅覆盖 5% 的美国职业,且成本低 500 倍。除了基准外,我们还引入了一种基于模拟的曝光度测量,旨在估算当前语言模型能力在所有美国职业的所有任务中可能节省的时间,并对每项估算进行详细记录。

我们的估算表明,目前的模型可以在 47% 的职业中为工人节省至少一半任务的时间。然而,在我们预测显著节省时间的 79% 的任务中,观察到的 Claude 使用率较低,表明现有使用情况未能发挥潜力。

除了语言模型聊天机器人的固有限制外,我们的数据还识别出隐私和专有系统是限制 AI 进一步节省时间的主要瓶颈。

总体而言,我们介绍了一种适应性基础设施,将语言模型在劳动市场的影响与其当前能力的推论相结合,随着能力的提高,这些推论可以不断更新。

博主点评: 这项研究通过 EconEvals 提供了一种创新的方式来评估语言模型在经济活动中的实际应用潜力,强调了模型在提高工作效率方面的重要性。然而,实际使用的低迷与潜在节省时间的对比,提醒我们在推广 AI 技术时需关注隐私和系统集成的挑战。

原文链接: https://arxiv.org/abs/2607.19375

[h] 返回首页