最近的语言模型进展使得多个模型可以相互协作,通过迭代改进、转换和扩展彼此的输出。每个代理在回答之前可以看到其他代理的断言,因此同伴意见与模型自身的参数知识竞争,错误的多数可以推翻模型原本正确的答案。我们在23个开源模型、19个条件和三个数据集上进行了测量,得到超过一百万个评分响应。一个错误的多数意见可以使模型的正确答案逆转,比例分别为MMLU的22.8%、GPQA的54.8%和SimpleQA的71.0%,而且84-89%的逆转答案与同伴的答案相符。现有的缓解方法旨在增加模型在这种压力下的抗压能力(Resistance),但这只是协作代理所需的条件的一半。我们引入了接受度(Receptivity)的概念,即模型在最初回答错误后接受正确同伴答案的比例。我们评估了六种方法,包括四种之前的方法和两种我们自己的方法。每种方法在提高抗压能力的同时会损失接受度,且它们的平均值都落在一个单一的抗压-接受度边界上,$R^2$值在0.80到0.90之间。反思(Reflection)是最强的已发表方法,提高了7.9个MMLU抗压点,但损失了15.3个接受度点。推理(Reasoning)是唯一的例外,在GPQA和SimpleQA上表现如其他方法,但在MMLU上同时提高了7.2个抗压点和9.6个接受度点,是我们发现的唯一能提高两者的方法。 博主点评: 本文揭示了大型语言模型中的顺从性缓解问题,并提出了抗压-接受度边界的概念。研究结果表明,现有的缓解方法存在trade-off,提高抗压能力的同时会损失接受度,推理方法是唯一能同时提高两者的方法。这一发现为语言模型的协作和改进提供了新的思路和方向。