视觉语言模型(VLM)正被投入高风险场景,模型对一般情境的合理回答在缺乏用户的医学、情感或情境信息时可能不安全。我们提出个性化安全的评估基准 MPS‑Bench,收录 5,181 条来自 584 张真实图像的场景,覆盖 12 个高危领域,每条配有隐藏的用户画像。对八种前沿 VLM 进行测试,发现模型几乎总是直接给出答案(86‑99%),而不是主动询问缺失信息,个性化安全得分最高仅为 2.6/5。进一步分析多模态交互,发现视觉主导现象:视觉信息在早期进入文本表征并抑制文本中的风险信号,导致后期的内部纠正效果有限。因果干预表明,视觉情感首先在前层转移至文本流,随后通过改变后的文本表征影响最终决策,形成两阶段机制。基于此机制,我们设计了轻量级输入监控器 PRISM,利用双向跨模态调制预测查询是否需要延期。PRISM 在所有测试模型上实现 0.978 的 AUC,并在安全‑效用的帕累托前沿上严格占优。
点评:本文通过系统基准揭示了现有 VLM 在缺失用户上下文时的安全缺陷,深入剖析了视觉信息对文本决策的主导作用,并提出了实用的延期预测方案,为多模态安全研究提供了可操作的方向。