摘要
文本生成图像(T2I)模型在合成高质量视觉内容方面取得了显著进展,但仍然容易受到恶意利用,尤其是在生成不适合工作的(NSFW)图像方面。现有的大多数越狱攻击主要依赖启发式提示工程或黑箱优化,将模型反馈视为二元信号(成功或失败)。这种粗糙的范式忽视了多样化失败模式中蕴含的丰富信息,如文本拒绝、视觉屏蔽和语义消毒,导致探索效率低下和严重的语义崩溃。
在本文中,我们提出了MIND,一个认知越狱框架,将对抗性提示生成重新构建为潜在防御机制上的信念状态推断问题。MIND并不是盲目搜索绕过提示,而是通过将多模态反馈视为高密度信号,主动建模目标系统的潜在防御机制。具体而言,该框架整合了三个核心组件:
- 多模态评判器:用于细粒度的反馈分解;
- 防御分析器:用于迭代的信念更新;
- 元记忆模块:用于检索历史有效的攻击策略。
这些组件统一在一个基于推理的进化优化过程中,使得越狱生成更加适应性和语义一致。
在I2P基准上的大量实验表明,MIND的有效性。在应用于Stable Diffusion v1.5模型的六个代表性预处理和后处理防御设置下,MIND的攻击成功率(ASR)达到了95.62%,显著优于现有方法。此外,该框架在四个广泛使用的商业T2I系统中的有效性也得到了验证,在Wan-2.5上达到了最高的ASR 91.58%。
博主点评: 本文提出的MIND框架通过对抗性提示生成的深入分析,为文本生成图像模型的安全性提供了新的视角,展现了在复杂防御机制下的高效性。这一方法的创新之处在于将多模态反馈转化为高密度信号,推动了越狱技术的前沿发展。期待未来更多类似的研究能够进一步提升模型的安全防护能力。