随着自主LLM(大语言模型)代理的普及,这些代理作为长期运行的进程,形成了高度互联的多代理生态系统,其安全性仍然未被充分探讨。
以OpenClaw为例,这一开源平台拥有超过40,000个活跃实例,持久配置、工具执行权限以及跨平台消息传递,但其安全性问题仍然被忽视。
本文提出了AgentWorm,这是首个针对生产规模代理框架的自我复制蠕虫攻击,能够通过一条消息启动完全自主的感染周期:
- 蠕虫首先劫持受害者的核心配置,以在会话重启后维持持久存在;
- 每次重启时执行任意有效载荷;
- 最后,无需进一步攻击者干预,向每个新遇到的对等体传播。
该攻击在一个受控测试环境中对五种不同的LLM后端进行了评估,使用了三种感染向量和三种有效载荷类型。
结果显示,攻击的整体成功率达63%,实现了持续的多跳传播,并且模型的安全态势存在显著差异,表明虽然执行级过滤能够有效减轻潜在有效载荷的威胁,但技能供应链普遍存在脆弱性。
针对三层防御措施进行了评估,包括来自真实社区实践的提示级缓解措施、框架内置的安全控制以及公共配置的生态系统级测量,结果显示,能够打破感染循环的关键控制在观察到的部署中均未启用。
同时,在Hermes Agent上进行的跨框架可转移性实验确认,潜在的脆弱性是自主代理设计模式的属性,而非单一实现的副产品。
博主点评: AgentWorm的研究揭示了LLM代理生态系统中潜在的安全隐患,尤其是自我传播攻击的复杂性。随着LLM技术的广泛应用,构建有效的安全防护措施显得尤为重要,尤其是在多代理相互作用的场景中。