小型认知模型的崛起
近年来,基于大型语言模型的认知代理逐渐成为研究热点。然而,实现这种能力所需的规模以及这些模型是否真正理解任务结构还是依赖统计捷径仍然是开放的问题。为了探索这些问题,我们训练了14个模型,参数规模从135M到14B不等,跨越四个不同的架构家族,并在Psych-101数据集上进行了实验。Psych-101包含了来自160个实验的1070万个试次级别的选择数据。
模型训练与评估
在分布内(in-distribution)评估中,不同规模的模型表现出惊人的相似性,仿佛都在一个性能天花板下。仅0.6B到1B参数的模型就足以匹配一个70B参数的基线模型在保持参与者(held-out participants)上的表现。然而,在分布外(out-of-distribution)评估中,更大的模型在推广到新任务结构方面表现出明显的优势。
诊断分析
为了深入了解这些模型利用的信息,我们进行了两项诊断分析。首先,我们逐渐移除四个提示通道:任务指令、实验刺激、结果反馈和选择历史,共计27个实验,并随机排列试次顺序。结果表明,遮蔽刺激和反馈的内容会摧毁75.7%的已学习信息,并使模型的表现下降到随机水平,证明选择历史本身并不能解释模型的性能。其次,试次顺序的排列揭示了模型在具有独立试次的任务上表现出不变性,但在试次顺序由前一次响应决定的任务上表现出敏感性。
结论
综上所述,小型认知模型在估计心理实验的噪声上限方面显示出希望,但其适用范围仍然受到训练中所见范式的限制。 博主点评: 本文揭示了小型认知模型在模拟人类行为方面的潜力,但也强调了其局限性和需要进一步研究的方向,为认知科学和人工智能领域提供了新的视角和研究基础。