NeFut Logo NeFut
EN 管理员登录

[AI学术] CogGym:面向大规模人机认知比较评估

发布于:2026-09-21 22:00 最后更新:2026-09-22 02:29
#AI #Machine Learning #Artificial Intelligence

CogGym 是一个基于认知科学的可扩展统一框架,旨在系统比较模型与人类在匹配实验试次上的行为。框架采用半自动、人工在环的流水线,将多样的实验范式标准化为任务无关的实验标记语言(EML),从而实现可复现、忠实的大规模比较。

在首次发布中,我们从 100 篇论文中整理并标准化了 258 项认知实验,主要聚焦人类常识推理,并用这些实验评估了 50 种大型语言模型的表现。结果显示,模型规模和新颖度越大,越能逼近人类判断,但提升速度明显慢于在数学、编码等形式推理基准上的进步。最佳模型在文本实验中的决定系数 $R^2$ 为 0.59,图像实验为 0.58,视频实验为 0.43;而人类的半分半可靠性分别为 $R^2=0.93$(文本)、$0.95$(图像)和 $0.92$(视频)。

CogGym 设计为一个持续更新的评估平台,未来将不断加入新的认知科学实验,以描绘模型行为何时接近人类、何时系统性偏离,并观察这些模式随模型和实验的演进而变化。

点评

原文链接: https://arxiv.org/abs/2609.21259

[h] 返回首页