NeFut Logo NeFut
EN 管理员登录

[AI学术] 语言模型组在重放人类推理任务的讨论时夸大共识

发布于:2026-09-19 22:00 最后更新:2026-09-20 12:54
#AI #Machine Learning #LLM

全文共识率常被视为集体认知的指标,但其数值取决于参与方式和最终状态的定义。我们对 100 组未见过的 Wason 人类小组进行重放,并匹配相同规模的大语言模型(LLM)代理小组。每位参与者的讨论前答案会生成一个信念锚定的代理,随后使用相同的评分代码对人和代理进行评估。根据不同的人类评分定义,完整共识率在 24.0% 到 57.0% 之间;约有五分之一的参与者从未发言,而代理几乎总是会发言。两项盲后敏感性分析显示,代理小组仍保持更高的共识度:提交基准比较(n = 98)下,聊天模式和推理模式的差距分别为 34.0 和 43.9 个百分点;参与度匹配比较(n = 45)下,差距分别为 34.1 和 44.4 个百分点。这两条路径分别消除了不同的测量不对称,但结果在 0.5 个百分点内收敛。即使取消提前停止并重新参数化以去除可记忆答案,差距仍然存在;此时推理模式的小组几乎一致,但大多给出错误答案。模拟共识并未反映集体准确性,信念锚定的代理小组在本实验设置中是对人类小组结果分布的有偏估计。这些分析提供了一套基于明确评分的框架,用于评估模拟小组对人类 deliberative 结果的估计。

点评

原文链接: https://arxiv.org/abs/2609.20543

[h] 返回首页