摘要
LLM代理作为系统的“大脑”,其能力使得分析范围超越了单一模型,因此安全性不仅仅关乎输入与输出内容的对齐,还涉及系统行为和现实执行结果。
然而,目前文献在攻击类型、应用和基准上碎片化,使得难以解释诸如提示注入、工具误用和内存污染等失败现象为何共享相同的结构性原因,以及它们如何在代理工作流中传播。
在本次调查中,我们将隔离视为LLM代理系统安全的首要原则。所说的隔离,指的是用户输入、工具访问、执行通道、代理间通信以及环境源上下文的分离。
我们通过一个以边界为中心的分类法组织文献,划分为五个边界:用户-代理、代理-工具、代理-执行、代理-代理以及系统-环境。这一视角有助于识别隔离首次丧失的地点,妥协如何在各个边界间传播,以及在每个接口上最相关的防御措施。
我们还总结了跨边界的失败路径,讨论了开放性挑战,并为未来代理系统中的隔离构建制定了研究议程。
博主点评: 隔离作为安全原则在LLM代理系统中显得尤为重要,能够有效应对多种安全挑战。这一研究不仅为理解系统脆弱性提供了框架,也为未来的安全防护措施奠定了基础。通过明确不同边界的角色与作用,研究者可以更好地设计防御机制,提升系统的整体安全性。