CogGym 是一个基于认知科学的可扩展统一框架,旨在系统比较模型与人类在匹配实验试次上的行为。框架采用半自动、人工在环的流水线,将多样的实验范式标准化为任务无关的实验标记语言(EML),从而实现可复现、忠实的大规模比较。
在首次发布中,我们从 100 篇论文中整理并标准化了 258 项认知实验,主要聚焦人类常识推理,并用这些实验评估了 50 种大型语言模型的表现。结果显示,模型规模和新颖度越大,越能逼近人类判断,但提升速度明显慢于在数学、编码等形式推理基准上的进步。最佳模型在文本实验中的决定系数 $R^2$ 为 0.59,图像实验为 0.58,视频实验为 0.43;而人类的半分半可靠性分别为 $R^2=0.93$(文本)、$0.95$(图像)和 $0.92$(视频)。
CogGym 设计为一个持续更新的评估平台,未来将不断加入新的认知科学实验,以描绘模型行为何时接近人类、何时系统性偏离,并观察这些模式随模型和实验的演进而变化。
点评