在视频大语言模型(Video LLMs)日益应用于实际场景的背景下,确保其安全对齐变得至关重要。令人意外的是,带有良性查询的有害视频的攻击成功率高于与显式有害查询配对的同一视频。
为了解这一脆弱性的内在机制,我们提出了V-DEAL,一个三层诊断框架,联合分析模型行为、理解和内部表示的失败。通过逐步排除感知失败并量化模型的内部拒绝倾向,V-DEAL为分析观察到的脆弱性提供了新的诊断视角。
我们在三个公共基准上测试了六种视频LLM,发现模型对有害视频内容的识别准确率超过81%,但在将有害视频与良性查询配对的情况下,平均攻击成功率仍然达到48.33%。隐藏状态分析进一步表明,视觉理解激活的拒绝倾向弱于文本理解。
此外,我们还引入了一种提示注入干预方法,平均降低了攻击成功率48.24个百分点,并实现了与先前基于微调的方法相当的性能,为解决视频LLM中的安全风险提供了有效且实用的手段。
博主点评: V-DEAL框架的提出为视频大语言模型的安全性提供了新的视角,尤其是通过分析模型的内部拒绝倾向,可以更深入地理解其脆弱性。这种方法不仅揭示了模型在处理良性查询时的潜在风险,还提供了有效的干预手段,值得在更广泛的应用中进行探索和验证。