本文探讨多代理辩论(MAD)是否因认知多样性而提升推理与事实性。我们在小型开源模型上进行可测量的实验,选取 23 种模型(来自 11 家供应商),覆盖 5 项任务,累计 5,500+ 次辩论与对照运行。\
我们沿三条轴线引入多样性:\
- 人格(persona)提示\
- 采样温度\
- 模型身份\ 每种辩论配置均配有等价生成预算的多数投票对照。\
实验结果否定了“多样性驱动”假设:\
- 在所有轴线上,辩论的优势均未显著提升\
- 辩论相较单模型推理提升 3–7 分(任务有余量),但在等预算条件下,仅与自一致采样持平或略逊,后者耗时约 1.6 倍、代价约 3.4 倍\
- 人格提示反而降低准确率;在全组合人格空间的剂量响应实验显示,这是一种“人格税”,而非多样性税:冗余人格损害最大,多样化团队只能部分恢复损失\
- 混合模型团队的表现不如同模型多数投票,准确率随成员能力而非异质性变化\
- 辩论收益几乎全部来源于首次答案交换\ \ 我们还发现一个普遍的测量风险:辩论记录常因超出上下文窗口而被截断,纠正后辩论与采样的比较从 -1.8 分提升至持平。\ \ 结论是,先前报告的 MAD 增益更像是集成采样效应,而非认知多样性本身。本文提供了经预算匹配、污染检查的基准,未来的辩论机制需在此之上实现突破。\ \ 点评