本文研究大型语言模型(LLM)之间的相互影响,模拟两类代理的对话:目标 LLM 扮演基于人口统计和心理属性的人格,影响者 LLM 旨在使目标的信念更加极端。我们考察两条激进化路径:共振——影响者强化目标已有的信念;说服——影响者推广目标最初不重视的信念。实验在情感和行为指标上发现,两种机制均能导致目标激进化,但共振的效应始终强于说服。不同的影响策略,如阿谀奉承和未经验证的主张,会产生不同程度的激进化,但在各指标上的表现并不一致。进一步分析表明,共振效应会向相关信念传播,暗示 AI 代理内部信念结构相互关联。总体结论是,个性化 AI 代理和多代理 AI 生态系统在收到与其已有信念一致的信息时,容易被激进化,需警惕其潜在风险。
点评