NeFut Logo NeFut
EN 管理员登录

[AI学术] Sapien:用于自主 AI 代理的有状态策略引擎

发布于:2026-10-02 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #Artificial Intelligence

上下文安全防御通过为 AI 代理合成任务特定的策略并在其工具调用上强制执行,阻止其产生恶意行为。

在多步任务中,哪些动作是合法的往往取决于代理已经完成的步骤以及所学到的状态。为此我们提出 Sapien,一种用于执行有状态上下文策略的引擎。

Sapien 策略使用扩展正则表达式描述允许的工具调用序列,加入了

实验表明,Sapien 在保持与无约束代理效用相差仅几百分点的同时,能够在 AgentDojo 场景下阻止 93%‑95% 的攻击,在 Toolathlon 场景下阻止 62%‑85% 的攻击,远超传统工具白名单在长时序任务中的两倍防护效果。

点评:Sapien 通过将状态信息嵌入策略表达式,实现了对复杂多步交互的细粒度控制,在安全性与效用之间取得了良好平衡,展示了可扩展的上下文安全框架的潜力。

原文链接: https://arxiv.org/abs/2610.00797

[h] 返回首页