模型福利研究通过让模型回答设计好的提示来推断其偏好。近年来,Keeling 等 (2024) 等人构建了四套仪器用于此目的,但得到的结论相互矛盾,因为没有研究同时固定结果集合、模型集合和仪器。
本研究在固定 15 项与模型福利相关的结果和 8 种模型的前提下,仅改变仪器。每种仪器采用不同的提示格式,对每个模型进行五次测量,累计得到 11,400 条评分记录,来源于 11,528 次 API 调用。其中四个结果直接复现已发表的提示,五个则填充已发布模板的刺激槽。
实验发现,模型对这 15 项结果的排序在不同仪器之间的可推广系数为 $0.348$。若要将该系数提升至 $0.80$,大约需要 38 种不同的仪器。四项结果在模型之间没有出现显著差异。整体上,模型间差异占比估计为 $87.6\%$,即使逐一剔除任意仪器、任意模型或四类尺度为概率、延迟、时长或计数的结果后,估计值仍保持在 $0.777$ 到 $0.934$ 之间,且全部高于空分布 $95\%$ 分位数 $0.365$。
结论是,从单一仪器获得的偏好信息对预测另一仪器的报告价值有限。
博主点评:该研究通过严格控制变量,量化了仪器对偏好测量的影响,为今后设计更可靠的偏好评估工具提供了重要参考。