摘要
多模态大型语言模型(MLLMs)在内容安全和审核任务中越来越普遍,但它们仍然容易受到对抗性攻击和分布外边界情况的影响。传统的主动学习和手动标注在应对新兴的多模态威胁的复杂性和数量时显得力不从心。
在本文中,我们提出了一种自动化的智能红队框架,系统地合成困难示例,采用迭代策略提出新假设并在过去的尝试上进行变异。我们利用一个多代理架构,其中包括高推理能力的架构代理、先进的图像生成器以及由大型语言模型(LLM)评估员组成的多层次验证委员会,系统能够在没有任何人类干预的情况下自主发现突破性违规和模糊的政策边界情况。
通过在测试时检索中使用这些精心合成的对抗性示例作为上下文演示,我们显著提高了目标模型的鲁棒性,将公共图像安全基准中的假阴性率(FNR)从 41.2% 降低至 24.5%,而无需依赖任何人类标注。
博主点评: 本文提出的自动化红队框架通过多代理系统有效提升了多模态模型的安全性,展示了在无人工干预情况下如何通过创新的对抗样本合成来增强模型鲁棒性,具有重要的应用价值和研究意义。此方法在未来的内容审核和安全性提升方面展现出广阔的前景。