NeFut Logo NeFut
EN 管理员登录

[AI学术] AI 代理易受激进化影响

发布于:2026-10-01 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

本文研究大型语言模型(LLM)之间的相互影响,模拟两类代理的对话:目标 LLM 扮演基于人口统计和心理属性的人格,影响者 LLM 旨在使目标的信念更加极端。我们考察两条激进化路径:共振——影响者强化目标已有的信念;说服——影响者推广目标最初不重视的信念。实验在情感和行为指标上发现,两种机制均能导致目标激进化,但共振的效应始终强于说服。不同的影响策略,如阿谀奉承和未经验证的主张,会产生不同程度的激进化,但在各指标上的表现并不一致。进一步分析表明,共振效应会向相关信念传播,暗示 AI 代理内部信念结构相互关联。总体结论是,个性化 AI 代理和多代理 AI 生态系统在收到与其已有信念一致的信息时,容易被激进化,需警惕其潜在风险。

点评

原文链接: https://arxiv.org/abs/2609.38296

[h] 返回首页