传统的渗透测试评估对手是否能够利用软件、基础设施、配置或操作控制中的弱点,以实现与安全相关的妥协。然而,这种范式在AI驱动的系统中已显得不足。在这些系统中,对手可能通过影响提示、检索内容、传感器输入、训练数据、内存、工具或人机交互循环,来改变系统行为,而无需直接妥协基础设施。本文将AI驱动系统的渗透测试重新框定为目标驱动的行为评估。
我们将AI驱动系统定义为那些学习模型在影响操作结果时起到重要作用的系统,并将AI驱动的渗透定义为在明确威胁模型下诱导违反一个或多个操作目标的AI治理行为。这一定义保留了传统渗透测试,同时扩展到诸如提示注入、间接提示注入、数据投毒、传感器操控、检索投毒、工具滥用和代理不一致等对抗路径。
我们进一步提出了一种测试工作流,识别操作目标,映射AI治理行为,分析对抗影响面,定义行为失败标准,执行基于场景的测试,并报告证据,将对抗行为与目标违规联系起来。通过一个涉及AI驱动的安全运营中心助手的实例,阐述了如何通过行为影响而非基础设施妥协来实现渗透。结合这些定义、工作流和实例,提供了一个评估已部署AI驱动系统中对抗成功的技术框架。
博主点评: 本文提出了一种全新的渗透测试视角,强调了对AI系统行为的评估。随着AI技术的不断进步,传统的安全评估方法已无法满足实际需求,本文的工作流为安全专家提供了新的思路,值得关注与深入研究。