NeFut Logo NeFut
EN 管理员登录

[AI学术] 多模态资源耗尽攻击:联合像素-提示优化

发布于:2026-09-10 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #optimization

资源耗尽攻击通常只针对视觉语言模型(VLM)的单一模态,假设图像是唯一可优化的输入,而用户可见的文本提示保持不变。即便是最近的循环式变体,也仍局限于单通道,未将跨模态的可控输入视为联合优化空间。本文提出 Joint Pixel-Prompt Optimization (JPPO),首次将可见提示提升为与图像扰动同等重要的对抗变量。在受限的联合输入威胁模型下,JPPO 采用分阶段的耦合优化,对像素和提示两条曲面同步搜索。该过程产生的成本放大效应与传统循环依赖的失效机制截然不同,实验中几乎不出现循环现象。我们在 MS COCO 与 ImageNet 上对五类开源 VLM(包括 Qwen2.5‑VL‑7B 与 BLIP‑2)进行评估,使用 $8/255$ 的 $\ell_{\infty}$ 预算。结果显示,JPPO 在 Qwen2.5‑VL‑7B 上实现了超过 $4.6\times$ 的延迟和 $5.3\times$ 的能耗放大,在 BLIP‑2 上则达到 $36.6\times$ 延迟和 $32.7\times$ 能耗放大,均显著优于所有基线且迭代次数更少。消融实验表明,放大效应来源于多模态协同,而非提示长度或单一模态的贡献。该工作揭示了现有 VLM 防御在结构上的盲点,呼吁在多模态部署中将成本感知的鲁棒性评估提升为首要安全需求。

点评

原文链接: https://arxiv.org/abs/2609.05889

[h] 返回首页