在不断发展的智能系统中,持续的状态通过记忆文件、行为偏好和知识库得以维护。这虽然提高了代理的实用性和自我改进能力,但也为记忆中的提示注入攻击提供了新的攻击面。
本文研究了基于记忆的智能系统中的提示注入攻击,利用沙箱合成工作区进行实验。
我们评估了两个智能系统:Anthropic Claude Code 和 OpenAI Codex,涵盖四个模型:Claude Haiku 4.5、Claude Opus 4.7、GPT-5.2 和 GPT-5.5。
结果表明,尽管通过不受信内容使代理覆盖自身的记忆文件较为困难,但已经植入那些文件中的有效负载仍能成功影响当前和未来的会话。
攻击的成功率和有效负载的持久性在不同系统、模型、对抗目标和多会话攻击序列中存在显著差异。
这些发现表明,持久记忆改变了提示注入的威胁模型,促使我们开发能够保护记忆更新而不移除有效代理适应性的防御措施。
博主点评: 本文深入探讨了智能系统中的记忆使用与安全性之间的矛盾,强调了在实现自我适应的同时,如何有效防御潜在的提示注入攻击。该研究为未来的智能系统提供了重要的安全思考,值得关注。