代理式系统正快速进入生产环境,它们会读取不可信输入、调用具备真实权限的工具并自主行动,这使得安全风险超出传统仅聊天的模型。现有评估大多是单轮交互,难以捕捉多步骤代理的漏洞。我们提出一种仅需基本系统描述的黑盒风险感知评估框架。框架核心包括七大领域分类法,将可观察行为映射到风险类别;全自动 SAGE-RT 红队生成器为每个领域产生 120 条对抗场景;以及使用 LLM 判官进行的人类验证评估。实验在两种代理架构(CrewAI 与 AutoGen)和四种基础模型上进行,结果显示治理风险平均 56.25%,多代理配置下隐私风险达 65%,代理行为漏洞最高可达 85%。该黑盒方法在无需特权访问的前提下,成功定位关键架构漏洞,为安全可扩展的代理部署提供了路径。
点评