上下文安全防御通过为 AI 代理合成任务特定的策略并在其工具调用上强制执行,阻止其产生恶意行为。
在多步任务中,哪些动作是合法的往往取决于代理已经完成的步骤以及所学到的状态。为此我们提出 Sapien,一种用于执行有状态上下文策略的引擎。
Sapien 策略使用扩展正则表达式描述允许的工具调用序列,加入了
- 有状态谓词:根据代理的历史行为动态决定后续是否可用;
- 延迟策略生成:在运行时根据最新上下文生成细化的约束;
- 作用域语义检查:在特定语义范围内验证调用是否合法。
实验表明,Sapien 在保持与无约束代理效用相差仅几百分点的同时,能够在 AgentDojo 场景下阻止 93%‑95% 的攻击,在 Toolathlon 场景下阻止 62%‑85% 的攻击,远超传统工具白名单在长时序任务中的两倍防护效果。
点评:Sapien 通过将状态信息嵌入策略表达式,实现了对复杂多步交互的细粒度控制,在安全性与效用之间取得了良好平衡,展示了可扩展的上下文安全框架的潜力。