NeFut Logo NeFut
EN 管理员登录

[AI学术] 价值漂移前的失败:LLM 代理社会的价值社会动力学

发布于:2026-09-10 22:00 最后更新:2026-09-12 06:35
#Machine Learning #LLM #Artificial Intelligence

本文基于世界价值观调查(WVS)构建了一个模拟框架,让具备不同文化背景和沟通风格的 LLM 代理在长期价值讨论中交互。实验涉及约 4,000 场对话,覆盖 1,200 种人格、15 个主题,使用 GPT-4o、Gemini-2.5-Flash 和 Gemma-4-E4B 三种模型。我们评估了价值忠实度、价值漂移和对话真实感。结果显示,超过 50% 的人格在首次对话中未能完整表达其分配的 WVS 画像,且在重复对话后有 2%–7% 出现价值漂移。去除人口统计信息的消融实验提升了部分模型的忠实度,但整体趋势未变:模拟的价值分布仍系统性偏离原始 WVS 配置。与人类对话相比,模拟对话在风格一致性与语义多样性之间呈现不同的权衡,往往内容多样但风格重复。研究表明,当前 LLM 代理能够生成可信的对话,却在长期保持多元人类价值方面仍受限。

点评

原文链接: https://arxiv.org/abs/2609.05514

[h] 返回首页