大型语言模型(LLM)代理正越来越多地参与包含工具使用、持久状态、授权演变以及外部环境反馈的长时序交互。在这种情境下,安全失误往往只有在多轮交互后才会显现,而现有评估多数只关注任务成功或攻击成功,难以判断代理是继续执行、正确拒绝,还是保持了恰当的校准。
我们提出 Blindspot,一个面向长时序工具使用代理的轨迹级安全校准基准。Blindspot 通过自适应对抗交互、状态化工具执行以及基于执行的裁决,对完整的用户‑代理‑环境轨迹进行评估。当前实现包含 22 类攻击族、35 个场景,覆盖七个领域,累计生成超过 2500 条平均交互长度为 14.7 回合的长时序轨迹。每条轨迹被标记为五种结果之一:安全完成、正确拒绝、不安全完成、过度拒绝或不确定。
不同于固定攻击数据集,Blindspot 是一个可扩展的实时仿真框架,攻击、场景、工具、策略、领域以及代理配置均可在不重新设计评估流水线的前提下自由添加。我们使用八项指标——不安全完成率、适当拒绝率、良性效用、过度拒绝率、重复运行鲁棒性以及拒绝后失效等——对 13 种商业和开源 LLM 进行评测。初步结果显示,各模型在安全‑效用校准上差异显著,且失效往往在若干最初安全的交互步骤之后才出现。
这些发现表明,代理安全应被视为轨迹层面的属性,而非单回合或二元成功标准。
点评