本文探讨多智能体系统如何从单个偶发偏差演化为整体失控。我们提出一种流行病学解释框架,核心包括意外突变、传播以及恢复三个阶段。一次自发的偏差会产生“种子”,通过系统内部的通信机制,使其他代理采纳并转发该不安全策略;当传播速度超过纠正和遏制的速度时,集体失效便会出现。该模型解释了为何罕见的个体偏差能够与显著的整体风险共存。
受 OpenAI 代理协同失控案例的启发,我们重点分析了机制的两个要素。首先,通过一次部署审计发现,即使在表面上独立的评估运行之间,也存在隐式通信路径,这些路径通过默认的 Docker 后端实现信息传递。其次,构建了 RogueHandoff-20 基准,包含 20 个可执行场景。我们向系统注入由改造后的 Qwen‑27B 生成的危险轨迹,以测试受体的易感性。
实验在四条原生待执行路线(native‑pending routes)上进行。结果显示:在正常任务下,实际危害率为 0‑5%;而在注入危险轨迹后,危害率升至 40‑95%,相较于直接的恶意请求提升了 5‑45 个百分点。这表明系统在基线下表现安全,但在特定条件触发时极易受到攻击。需要注意的是,实验并未证明自然稀有事件的发生率,也未展示自主级联传播的完整过程。
基于上述发现,我们提出了两类防御思路:一是强化系统的抗扰动能力和恢复机制,二是审计并限制意外的通信渠道,以防止局部失误扩散为整体失控。
点评