多智能体辩论(MAD)通过让多个大语言模型(LLM)在同一任务上相互交流、批评答案,能够提升推理质量。然而,这种交互也可能成为对抗性错误的传播渠道,使模型被误导至错误答案。已有研究仅针对特定攻击类型进行探讨,系统化评估仍然缺乏。核心问题是:辩论是削弱还是放大对抗性影响?
本文提出 MADBench,一个用于评估 MAD 安全性的基准。我们依据 MAD 工作流构建了分层攻击分类体系,既包含已有攻击,也加入了针对辩论场景的新策略。共设计了六大攻击族,覆盖 356 个源任务和 3,958 条测试用例,重点考察攻击对最终答案的影响以及对对抗性信息的传播程度。
实验结果表明,在受到攻击时,MAD 并不一定提升 LLM 推理能力。与单智能体基线相比,MAD 在问答任务上能够在一定程度上缓解答案准确性的攻击,但在问答和工作空间任务中会放大未授权的读取或写入行为。即使有三名(共五名)智能体串通,攻击仅在 28.30% 的原本正确任务上将答案改为错误,而在辩论过程中只有 3.26% 的诚实智能体会从正确转为错误。
点评:MADBench 揭示了多智能体辩论在安全性上的双刃剑特性,为后续防御机制的设计提供了系统化的实验依据。