摘要
LLM基础的多智能体系统(LLM-MAS)越来越多地应用于安全关键的场景中,然而,敌手通过智能体之间的通信注入恶意指令,传播有害行为。这些攻击不同于静态威胁,具有双重动态性:敌手在针对已部署防御措施时不断优化注入策略,而正常智能体的行为也随着系统扩展而漂移。现有防御措施将部署视为封闭世界问题,这导致一旦分布超出训练覆盖范围,防御效果迅速下降。
我们提出了OpenEvoShield,一个为LLM-MAS设计的共同进化持续防御框架。该框架包含以下几个关键组件:
- 不对称速率控制器(M1):解耦快速攻击侧和缓慢正常侧的学习速率,基于双漂移信号进行调整。
- 正常边界更新器(M2):以较慢的速率维护动态行为边界。
- EWC正则化的策略集成(M3):在快速适应的同时防止灾难性遗忘。
- 基于能量的多粒度检测器(M4):融合节点、子图和图级别的证据,将新型攻击分类为分布外。
在五个基准和四种MAS拓扑结构的100个部署轮次实验中,OpenEvoShield表现优于静态和持续基线,能够检测到大多数之前未见过的攻击,同时保持低假阳性率。
博主点评: OpenEvoShield的设计理念切合实际应用场景,针对动态变化的攻击策略提出了有效的防御机制,展现了在多智能体系统中持续学习的潜力,为未来智能系统的安全性提供了新的思路。其多层次的检测方法也为复杂系统的安全防护提供了参考。