NeFut Logo NeFut
EN 管理员登录

[AI学术] 语言模型的选择一致性:一词调查的深度解析

发布于:2026-07-16 22:00 最后更新:2026-07-17 08:45
#Language Model #Conformity #One-Word Census

摘要

在语言模型需要从大量同样有效的选项中选择一个答案时,它们选择的是什么?在被要求“选一个词——任何词”时,44个模型选择“serendipity”的频率高达41%。我们使用31个单轮提示对这种收敛性进行了刻画,每个提示都命名了一个类别,包含多个有效的一词答案(如“命名一个树木”),每个模型被询问四次,没有系统提示。这一分析是基于标准化令牌的精确匹配——没有嵌入,没有评判,成本约为每个模型一美元。

模型收敛性已被广泛记录;我们的贡献在于这一工具本身——一词调查及其揭示的收敛结构。我们通过答案选择的惊讶度为每个模型打分:即其答案在所有其他模型的汇总答案下的平均 $-\log_2$ 概率,留一法分析。收敛性极为明显——在31个类别中,有7个类别的某个答案占据了超过80%的所有答案。然而,不同模型之间的符合程度变化超过四倍,这种变化是有结构的。个性化和社区调优的模型表现出较大的差异性;最新的主流旗舰模型则是最符合的,几乎没有提供其他模型未给出的答案。

在四个谱系(Claude、GPT、Qwen、Grok)中,随着每一代的更新,符合度逐渐上升,但在最新的旗舰Claude和GPT模型中却逆转,这可能是顶层重新定位的早期信号。根据人类类别生产的规范,该领域在20个共享类别中,有18个类别的集中程度高于人类。

所有提示、记录和代码均为公开。

博主点评: 本研究揭示了语言模型在选择答案时的高度一致性,尤其是旗舰模型的收敛性显示出对特定答案的强烈偏好。这一发现不仅对模型的设计和优化提供了启示,也引发了关于模型多样性和创新性的深入思考。

原文链接: https://arxiv.org/abs/2607.12796

[h] 返回首页