NeFut Logo NeFut
EN 管理员登录

[AI学术] AgentWorm:自我传播攻击在LLM代理生态系统中的威胁

发布于:2026-07-19 22:00 最后更新:2026-07-22 01:02
#algorithm #Open Source #Security

随着自主LLM(大语言模型)代理的普及,这些代理作为长期运行的进程,形成了高度互联的多代理生态系统,其安全性仍然未被充分探讨。

以OpenClaw为例,这一开源平台拥有超过40,000个活跃实例,持久配置、工具执行权限以及跨平台消息传递,但其安全性问题仍然被忽视。

本文提出了AgentWorm,这是首个针对生产规模代理框架的自我复制蠕虫攻击,能够通过一条消息启动完全自主的感染周期:

  1. 蠕虫首先劫持受害者的核心配置,以在会话重启后维持持久存在;
  2. 每次重启时执行任意有效载荷;
  3. 最后,无需进一步攻击者干预,向每个新遇到的对等体传播。

该攻击在一个受控测试环境中对五种不同的LLM后端进行了评估,使用了三种感染向量和三种有效载荷类型。

结果显示,攻击的整体成功率达63%,实现了持续的多跳传播,并且模型的安全态势存在显著差异,表明虽然执行级过滤能够有效减轻潜在有效载荷的威胁,但技能供应链普遍存在脆弱性。

针对三层防御措施进行了评估,包括来自真实社区实践的提示级缓解措施、框架内置的安全控制以及公共配置的生态系统级测量,结果显示,能够打破感染循环的关键控制在观察到的部署中均未启用。

同时,在Hermes Agent上进行的跨框架可转移性实验确认,潜在的脆弱性是自主代理设计模式的属性,而非单一实现的副产品。

博主点评: AgentWorm的研究揭示了LLM代理生态系统中潜在的安全隐患,尤其是自我传播攻击的复杂性。随着LLM技术的广泛应用,构建有效的安全防护措施显得尤为重要,尤其是在多代理相互作用的场景中。

原文链接: https://arxiv.org/abs/2603.15727

[h] 返回首页