摘要
持久的外部内存增强了代理的连续性,但也引入了持久的安全漏洞:对抗性内容可以通过标准交互渠道注入,并在多个回合中保留,进而扭曲下游行为。为了解决这一挑战,我们提出了MemPoison,一个综合基准和分析框架,涵盖1227个经过人工验证的案例,涉及四种攻击类型、三种注入渠道和三种代表性的内存基础,评估了七个开放权重和三个封闭权重的模型系列。
三层分类法
我们引入了一个三层分类法:
- L1: 直接单条记录腐败
- L2: 组合多条记录腐败
- L3: 上下文触发的潜伏腐败
我们的评估揭示了一个明显的防御前沿:尽管基线写时防御,比如一致性检查,显著抑制了直接的L1攻击,但它们无法可靠地抑制L2和L3攻击。
通过机械影响分解(MID),我们展示了写时防御中的结构盲点,这些盲点允许看似无害的记录在联合检索组合或触发条件激活后变得有害。
我们的研究结果主张从静态过滤转向自适应的、上下文敏感的内存防御策略。
博主点评: MemPoison框架的提出为持久内存的安全性提供了新视角,尤其是在对抗性内容注入方面。它不仅揭示了现有防御措施的不足,还强调了需要探索更动态的防御机制,这对未来的LLM应用至关重要。