人类反馈对齐让语言模型成为有用的助手,常被描述为与人类对齐。然而,AI的响应被人们偏好,并不一定等同于人们自己会给出的答案。我们区分了对齐人类偏好和对齐人类行为,并证明在偏好对齐的情况下,即使偏好和响应全部来源于人类,模型行为也可能变得不那么像人。我们称之为图灵测试差距。我们指出,只有在一个严格的条件下,偏好对齐才能保持人类响应分布,而实际的人类偏好并未表现出一致满足该条件的证据。实验表明,随着偏好权重的增强,无论方向如何,人类响应的似然性都会下降,这一现象在标准的 DPO 中同样出现。结果表明,人类相似性应作为对齐的显式维度,而不是从偏好对齐自然得到的假设。
点评