摘要
随着大型语言模型(LLMs)在日常敏感场景中被广泛应用——提供个人建议、心理健康支持和道德指导——理解它们在复杂道德推理中的行为变得至关重要。大多数评估通过单轮提示研究这种社会技术对齐,但尚不清楚这些发现是否适用于多轮设置,也不清楚它们如何依赖于用于协调代理系统的互动协议。我们通过LLM辩论填补这一空白,检验多轮设置中的审议动态和价值对齐,提示三种模型(GPT-4.1、Claude 3.7 Sonnet和Gemini 2.0 Flash)对来自Reddit“我是不是混蛋”社区的1000个日常困境进行集体指责。
为了测试顺序效应并评估判决修正,我们使用了同步(并行响应)和轮循(顺序响应)辩论结构,反映了多代理系统在实践中日益被协调的方式。我们的研究结果显示出显著的行为差异。在同步设置中,GPT-4.1表现出强烈的惯性(修正率为0.6-3.1%),而Claude 3.7 Sonnet和Gemini 2.0 Flash则更加灵活(修正率为28-41%)。价值模式也存在差异:GPT-4.1强调个人自主和直接沟通(相对于其审议伙伴),而Claude 3.7 Sonnet和Gemini 2.0 Flash则优先考虑同理心对话。
我们进一步发现,辩论格式对模型行为有显著影响:GPT-4.1和Gemini 2.0 Flash相较于Claude 3.7 Sonnet表现出高度的顺从,其判决行为受到顺序效应的强烈影响。此外,我们还提供了关于开源模型(DeepSeek-V3.2和Llama 3.1)的额外结果。
博主点评: 本文通过多代理系统的辩论探索道德判断的复杂性,揭示了不同模型在互动协议下的行为差异。尤其是GPT-4.1在多轮对话中的保守性与其他模型的灵活性形成鲜明对比,提示我们在实际应用中需重视互动协议的设计。