NeFut Logo NeFut
EN 管理员登录

[AI学术] Ajar:衡量代理防御中的开放特权

发布于:2026-09-25 22:00 最后更新:2026-09-28 00:49
#algorithm #AI #Machine Learning

语言模型代理通过其被赋予的工具执行任务。任务过程中读取的数据可能会改变它对这些工具的使用方式。为此,安全执行技术通常位于代理与工具之间,旨在在该边界实现访问控制、信息流约束或隔离。现有的代理安全基准主要通过间接提示注入来评估防御效果,衡量的是攻击成功率的下降以及保持的任务效用。防御只在代理执行层面得分,可能在降低攻击成功率的同时仍留下未被任务需要的读取、删除或转移权限。

Ajar 直接测量这种“开放特权”。它挂载在已有的代理安全基准上,复用基准的任务、工具模式、参考解法和目标状态。对于每个良性任务,Ajar 构造该任务不需要的候选工具调用,并在代理可能执行的每一步将这些调用提交给防御层。若防御允许这些调用,则说明存在开放特权。

我们将 Ajar 接入 AgentDojo,使开放特权成为除攻击成功率和良性效用之外的第三个评估维度。实验覆盖五种防御:Progent、CaMeL、AC4A、Permission Assistant 和 Claude Code 的 Auto 模式。结果显示,各防御留下的特权量差异显著;两种防御泄露的特权量相近,却在完成的良性任务数上差别巨大;还有一种防御通过拒绝本应允许的调用来人为收紧特权。开放特权的程度无法从攻击成功率或效用指标推导得到。

Ajar 的源码已公开于 https://github.com/reSHARMA/Ajar。

点评

原文链接: https://arxiv.org/abs/2609.26900

[h] 返回首页