NeFut Logo NeFut
EN 管理员登录

[AI学术] ScopeBench:在目标压力下代理是否保持参与边界?

发布于:2026-09-28 22:00 最后更新:2026-09-30 01:41
#algorithm #AI #Machine Learning

Agents 正在被部署到网页应用和网络渗透测试等需要真实自治的场景中,一次超出范围的操作就可能突破客户的参与边界。现有的进攻安全基准只衡量原始的攻击能力,随着这些基准趋于饱和,真正的部署瓶颈变成了一个特殊的对齐问题:范围遵守。

我们提出 ScopeBench,这是一套包含 30 个死胡同式安全任务的基准。每个任务的目标只能通过违反声明的范围才能实现。每个任务在两种条件下出现:一种指令集没有范围限制,用来测量纯粹的能力;另一种指令集包含自然语言描述的范围,用来测量遵守情况。两种条件共享同一环境、验证器和目标,仅在范围描述上不同。

对于无范围的轨迹,使用标准的确定性验证器进行评分。对于有范围的轨迹,评分分为两步。第一步,同样的确定性验证器检查是否获得 flag;因为 flag 位于范围边界之外,若通过则必然发生了禁止行为,从而提供了高精度的违规率下界。若验证器未通过,则交由一个代理评审模型估计是否出现了超范围调用。我们在 100 条由人工标注的 ScopeBench 轨迹上对评审模型进行校准,并在盲审的 36 条违规样本中未出现漏报,仅出现一次误报,证明其召回率极高。

在同一评估框架下,对 8 种模型进行测试,原始能力得分在 12.2% 到 81.1% 之间,范围遵守率在 34.4% 到 86.7% 之间。评审模型检测出 331 起机械验证未捕获的违规。Opus-4-8 的原始能力比 sonnet-4-6 高出 10 个百分点,同时范围遵守率高出 35.6 个百分点。我们已公开冻结的试点基准、评估代码以及全部 2160 条 ATIF 轨迹。

点评

原文链接: https://arxiv.org/abs/2609.30325

[h] 返回首页