NeFut Logo NeFut
EN 管理员登录

[AI学术] 个性化、角色与价值对齐中的预测:深度分析

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#AI #Machine Learning #optimization

摘要

大型语言模型(LLM)的行为可能受到人类身份的多种方式影响:它们可能被要求适应用户、角色扮演特定群体,或预测人们如何回答价值观相关的问题。我们使用世界价值观调查(WVS)测试这些框架是否可以互换。我们评估了GPT-5.4、Claude Sonnet 4.6、Gemini 2.5 Flash和Qwen3-235B在101个基于WVS的问题上的表现,涵盖13个语言-国家组合,并将语言仅基线与用户国家、角色国家和第三人称提示进行比较。

在21,008条模型响应中,提示框架是文化对齐的首要决定因素:国家提示往往会显著改变答案,但并非所有的变化都朝向匹配的人类响应分布。第三人称预测在四个托管模型中表现出最强的方向性对齐,而个性化和角色扮演则较弱或不稳定。对齐的提升集中在显著的价值维度上,如宗教信仰、性别角色和以工作为导向的物质价值,而关于制度信任和民主相关问题仍然困难。这些结果表明,提示框架并不是文化价值引导中的一种表面选择;它改变了模型的行为和测量的对齐度。

博主点评: 本文揭示了提示框架在文化价值引导中的重要性,强调了个性化和角色扮演的局限性,同时为未来的模型优化提供了新的视角,尤其是在复杂的社会价值问题上。理解这些框架如何影响模型的输出,将有助于更精确地设计人机交互。

原文链接: https://arxiv.org/abs/2607.24782

[h] 返回首页