NeFut Logo NeFut
EN 管理员登录

[AI学术] ChannelGuard:安全模型如何构建安全的多智能体系统

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #optimization

摘要

多智能体大语言模型应用整合了规划者、工作代理、验证者和合成器,每个代理之间的交互都是一个不受监控的通道,攻击者可以通过该通道传递指令。现有的防御措施仅保护输入边界(如 IBProtector、Llama Guard、困惑度过滤器、SmoothLLM),或者在应用之外运行,作为不透明的随机提供方过滤器。我们展示了这种防御缺口的后果:在对 2100 个追踪的评估中,涉及八种攻击类型、五种防御措施和三种模型后端,一个未防御的管道在标准报告下似乎完全安全(工具和内存中毒攻击成功率为 0.000),而这种安全性几乎完全依赖于云提供商的服务器端过滤器(在 Azure GPT-5 上 54 个阻止 60 个),并在没有此类过滤器的后端上转移到代理模型自身的对齐。仅报告结果隐藏了这种依赖关系。

我们提出了 ChannelGuard,这是一种无训练的深度防御框架,在每个代理之间的通道上设置信息瓶颈门;每个门根据嵌入相似性对通道文本进行评分,并从对抗短语库中确定性地通过、压缩或阻止该文本,而不会增加 LLM 调用。同时,一种归因方法记录哪个层级阻止了每个攻击。ChannelGuard 的工具输出门在应用层阻止了 30 次工具中毒攻击,在 Azure GPT-5、Anthropic Sonnet 4.5 和 Anthropic Haiku 4.5 中表现一致,而未防御的管道在后端之间完全转移;它还将提示注入攻击的成功率降低了一半(从 0.333 降至 0.167),并准确保留 GSM8K 的准确性(0.867)。白盒自适应改写能规避每个嵌入门,而扰动和投票基线的表现更好。扩展附录提供了基线、消融实验、参数扫描、良性保护分析和评审审计(kappa = 0.900),总成本为 47.36 美元。

博主点评: ChannelGuard 提供了一种有效的防御机制,通过在多智能体系统中引入信息瓶颈,解决了现有防御措施的不足。这种方法不仅增强了系统的安全性,还降低了对云服务提供商的依赖,展现出深度防御的潜力。未来的研究可以进一步优化嵌入相似性评分和对抗短语库的构建。

原文链接: https://arxiv.org/abs/2607.19430

[h] 返回首页