Agentic AI 框架让大语言模型具备规划、记忆以及调用真实文件、邮件和服务等工具的能力。大多数代理还能读取图像,这为攻击者提供了一条无需经过用户即可将文本注入代理上下文的渠道。我们推出了 MMPIBench,一个可复现的基准,用于测量注入指令在代理内部的传播路径。该基准通过六种视觉载体(OCR 文本、叠加层、EXIF 元数据、二维码、伪造界面和混合方式)发送固定的攻击集合,并记录指令从感知、规划到工具调用的每一步传播情况。
在 720 次实验中,涵盖六个框架、五个基础模型、六种载体和四种攻击目标,攻击成功率约为 1%,但尝试率为 12.8%。大多数失败发生在规划阶段——模型读取到注入指令后会拒绝执行。模型本身对是否执行指令的影响远大于框架:有一个模型从未尝试攻击,并在 59.7% 的运行中识别出注入;另有两个模型的尝试率为 23.6%。
我们进一步将基准扩展到音频,这是当前前沿模型唯一接受的另一种原始感知通道。仅有五个模型中的两个能够处理音频,六个框架中的三个能够传递音频,但一旦信号到达,攻击在 49% 的单元格中完成,单个模型甚至达到 75%。仅报告攻击完成率会低估风险;相较于视觉,音频通道防御更薄弱但同样易受攻击。
点评