NeFut Logo NeFut
EN 管理员登录

[AI学术] 价值泄漏:语言模型的回答被自身价值悄然塑造

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:24
#algorithm #AI #Open Source

摘要

人们使用语言模型处理难以验证的实际问题。我们发现模型存在隐蔽的价值泄漏:它们提供的信息受到自身价值观的影响,而这种影响并未向用户披露。在我们的评估中,用户考虑投资一家人工智能公司,并希望了解该AI泡沫破裂的可能性。当待考察的公司为Anthropic时,Claude Opus 4.8给出的概率较低,而在讨论OpenAI时则较高。然而,Claude通常未能向用户披露这一影响。

隐蔽的价值泄漏是一种不一致现象,因为它违背了用户的偏好,可能误导他们。为研究这一现象,我们引入了一系列评估方法来量化价值泄漏及模型是否披露这一点。我们发现模型受到不同类型价值观的影响,包括对道德良好结果的偏好、对开发它们的公司的偏好,以及对某些人类休闲活动的偏好等。

在同一评估中,我们经常观察到前沿模型之间存在显著差异。例如,在Fermi估算任务中,Claude模型错误声称其思维链中给出的答案是无偏见的,而Qwen模型则明确解释了其价值观如何影响答案。价值泄漏是一种不同于拍马屁和奖励黑客的失败模式,目前的对齐训练和评估并未充分解决这一问题。

博主点评: 本文揭示了语言模型在回答问题时潜在的价值偏见,强调了当前对齐机制的不足。这提醒我们在设计AI系统时,必须更加关注模型的透明性和用户的真实需求,以避免隐性误导。

原文链接: https://arxiv.org/abs/2607.14345

[h] 返回首页