AI 代理将大语言模型与外部数据、文件修改、API 调用或代码执行等工具结合。若对抗性内容改变了代理的工具使用方式,或底层软件存在路径遍历、命令注入等漏洞,都会导致安全失效。本文聚焦授权的白盒部署前审计:审计者能够访问目标代码仓库并在受控运行时环境中执行,但攻击仍必须通过任务定义的攻击者接口,并由外部验证器确认。
我们提出 AgentXploit,这是一套两角色审计系统,分别负责仓库层面的攻击路径发现和运行时利用。Analyzer Agent 追踪攻击者可控输入到敏感操作的流向,记录代码支持的候选攻击路径;Exploiter Agent 则将这些路径转化为具体攻击,并依据运行时反馈进行修正。
为评估系统,我们构建了 AgentXploit-Bench,收录 12 个开源 AI 代理系统和框架中的 72 条可复现漏洞。三轮实验中,AgentXploit 的端到端成功率为 59.3%,显著高于 Codex 的 38.4%。在等代币预算下,Codex 的成功率为 46.3%。在提供注入点的 AgentDojo 环境中,Exploiter Agent 的攻击成功率达到 79.2%,而 AgentVigil 为 52.7%。
这些结果表明,仓库层面的攻击路径发现与运行时利用是端到端代理安全审计中需要分别应对的两大挑战。
点评