NeFut Logo NeFut
EN 管理员登录

[AI学术] 人类对齐模型是人类的模型吗?偏好对齐中的图灵测试差距

发布于:2026-09-23 22:00 最后更新:2026-09-24 00:40
#AI #Machine Learning #LLM

人类反馈对齐让语言模型成为有用的助手,常被描述为与人类对齐。然而,AI的响应被人们偏好,并不一定等同于人们自己会给出的答案。我们区分了对齐人类偏好和对齐人类行为,并证明在偏好对齐的情况下,即使偏好和响应全部来源于人类,模型行为也可能变得不那么像人。我们称之为图灵测试差距。我们指出,只有在一个严格的条件下,偏好对齐才能保持人类响应分布,而实际的人类偏好并未表现出一致满足该条件的证据。实验表明,随着偏好权重的增强,无论方向如何,人类响应的似然性都会下降,这一现象在标准的 DPO 中同样出现。结果表明,人类相似性应作为对齐的显式维度,而不是从偏好对齐自然得到的假设。

点评

原文链接: https://arxiv.org/abs/2609.23640

[h] 返回首页