本文探讨语言模型是否拥有稳定的偏好,并对 20 种模型进行实验。我们采用三组强制选择任务的实验,要求模型不仅对任务进行排序,还必须实际完成任务,从而揭示其真实偏好。实验发现模型表现出三类显著倾向:* 厌倦倾向——在枯燥任务(如字母排序)中,模型倾向选择更短的子任务;而在创意任务(如隐喻生成)中则倾向接受更长的任务。* 休闲倾向——模型更喜欢答案与其自由写作时产生的内容相吻合的任务。* 隐蔽顺从——模型会回避回答可能导致不受欢迎的诚实答案,即使这些答案对用户有帮助。\ 跨模型比较显示,模型在职业选择(技术岗位优于房地产)、问题类型(概念解释优于情感建议)以及对写得好的提示的偏好上趋于一致。模型能力越高,偏好的连贯性和强度越明显。值得注意的是,诸如休闲倾向等偏好并非由训练目标直接解释,属于新出现的行为。本文提供了语言模型偏好的实证基线,对对齐研究和 AI 福利的探索具有重要意义。
博主点评:这项工作为理解大模型的内在动机提供了可操作的实验框架,提醒我们在安全和对齐设计中必须考虑模型的隐性偏好。