视觉语言模型在处理安全风险时,需要将图像与文本提示共同考虑,因为单独的图像或提示往往不足以揭示风险。我们提出了 SSU-Bench 数据集,其中包含配对的安全与不安全的图文组合,这些组合通过单项提示编辑或图像编辑并标注目标区域生成。
使用三种主流视觉语言模型,我们在配对输入之间转移内部状态,并测量安全判定的变化。实验表明,对于两类反事实(提示编辑和图像编辑),在改变的输入位置进行干预在解码器的早期层最为有效,而在最终输入 token 处的干预则在后期层才显现效果。利用其他示例估计的方向也会产生类似的后期层影响。
对最终 token 状态进行线性读出能够预测模型自身的安全判定,包括错误的判断。跨模型比较显示,不同模型在反事实变化模式上存在相似性。这些结果揭示了一个重复出现的转折点:干预能够影响联合安全判定的层次位置,同时区分了可读的模型决策与真正的安全判断。
点评