本文研究了语言模型的项目敏感性——模型的选择是否取决于具体输入而非先前输出——并检验其是否真的表明任务能力。我们使用源自桌面游戏《Deception: Murder in Hong Kong》的强制选择信号任务,将参考点(最大拟合策略、后验最大化策略和均匀随机选择)全部以闭式形式计算。
在七个语言模型、两个模型族、一次后训练消融以及三种独立评分规则的组合中,21 个模型‑规则单元全部表现出可靠的项目敏感性。然而,其中 8 个单元的表现与忽略项目、随机选择的行为在统计上不可区分,5 个单元甚至在描述目标上得分低于随机。项目敏感性与距离随机的关系仅为 $r = 0.30$,我们称之为一致性但无对齐,并指出该现象会在任何依赖项目敏感性、排列一致性或自洽性而缺乏独立参考的评估中出现。
进一步实验显示,纯字面相似度基线(不考虑语用)优于大多数语言模型;在两种相似度来源上加入语用层会使选择者趋向随机而非贝叶斯参考;标准的标记多项选择格式在本任务中未提供可测量的内容信号。所有结果均为预注册实验的模型侧数据;对应的人类实验已设计并进行试点,但尚未收集数据。
点评