深度神经网络(DNN)因其强大的表达能力在众多任务中取得了显著成功,但研究表明它们容易受到对抗样本的攻击。传统对抗样本通常通过限制扰动的 $L_p$ 范数来保持“微小扰动”。本文关注语义层面的操控,即通过改变图像的语义属性来生成无限制对抗样本。我们提出了算法 SemanticAdv,利用可解耦的语义因子,在受控的属性空间中进行编辑,从而使模型的预测偏向预设的对抗目标。实验在人脸验证、关键点检测等任务上验证了语义对抗样本的有效性,并在 Azure 人脸验证等真实黑盒服务上实现了高成功率的迁移攻击。进一步,我们将同样的语义编辑应用于街景图像,展示了该方法在非人脸领域的可扩展性。通过受控的语义变化,SemanticAdv 揭示了 DNN 对高层语义信息的脆弱性,为防御机制的设计提供了新视角。
点评