NeFut Logo NeFut
EN 管理员登录

[AI学术] 声誉、策略与情感对生成式 AI 合作的影响:推理模型与非推理模型的比较

发布于:2026-10-03 22:00 最后更新:2026-10-06 12:11
#Machine Learning #LLM #Artificial Intelligence

我们使用迭代囚徒困境考察前沿生成式 AI(Gen AI)模型的合作倾向,分别操控对手的声誉(正面、未知、负面)、策略(敲诈或慷慨)以及非语言情感信号(面部表情传递竞争或合作评估)。

在第一组实验中,使用非推理模型 Claude 3.5、Gemini 2.0 Flash 和 GPT‑4o。结果显示,合作水平受到三类因素的系统性调节,呈现出与人类行为研究长期记录相似的模式,但不同模型对每个因素的敏感度差异显著。

第二组实验转向推理模型 Claude 4.6、Gemini 3 和 GPT‑5.2。此时模型对策略和声誉的依赖更为集中,原先在非推理模型中观察到的 Potemkin 效应几乎消失(在诊断性和谐游戏中出现近乎统一的合作),情感信号的影响转为条件性,表现为层级线索加权而非单纯的社会敏感度下降。推理模型还展示出多样的终局行为:有的保持合作,有的在最后一轮系统性背叛,揭示了模型特有的可利用性特征,对谈判等多轮交互的实际部署具有直接意义。

这些发现表明,生成式 AI 正在演化为日益复杂但仍具异质性的社会行为体,强调建立标准化合作基准以指导其在交互式、社会影响深远场景中的负责任部署的重要性。

点评

原文链接: https://arxiv.org/abs/2610.01222

[h] 返回首页