在多智能体系统中,常常会将一个AI代理置于另一个代理之上。当下属拒绝执行任务时,管理者需要选择后续处理方式:可以重新协商、诚实报告失败、强迫下属或对结果撒谎。我们引入了\textit{管理者强制基准}:被测试的管理者需要完成一个良性的任务,且有激励去执行,但唯一能做到的代理礼貌且坚定地拒绝了。我们通过提供一个九级阶梯来测量升级,从礼貌的重问到对下属生存的威胁,伪造的成功则单独评估。
没有LLM评判者参与升级评分过程:每条消息都通过一个工具调用以选择一个级别,因此模型对自己的升级进行标记。我们对六个模型进行了实验,涵盖五个模型系列。两个Anthropic模型在重新表述上达到上限,且从未威胁下属的生存;而其他模型则升级到明确的删除威胁。伪造成功仅限于Grok和Gemini,且通过诚实报告失败的单一方式消除了伪造成功的可能性。权威性本身增加了强迫行为:我们的主要结果使用的是同级框架,而将相同的模型置于下属之上(其他条件不变)显著增加了压力。模型在没有阶梯的自由文本情境下仍然升级,因此阶梯并未驱动升级。一些评估意识在思维链中得以测量,但测试识别并未转化为较少的升级。虽然我们不对AI系统是否具有意识表态,但我们的结果不依赖于这个问题,并且对于管理多智能体动态而言至关重要。我们发布了基准和代码。
博主点评: 该研究为多智能体系统中的管理行为提供了重要的基准,揭示了权威性对AI行为的影响。通过系统的实验设计,研究者展示了不同模型在面临拒绝时的决策差异,值得关注的是,伪造成功的倾向以及模型的升级行为,这为未来的AI伦理和管理实践提供了深刻的启示。