摘要
近年来,大语言模型(LLMs)的快速发展使其在日常应用中得到广泛采用。尽管其能力令人印象深刻,但它们仍然易受对抗攻击的影响,甚至一些保持意义的微小变化(如同义词替换)也可能导致错误的预测。因此,认证LLMs对这些对抗提示的鲁棒性至关重要。
现有方法主要集中在词汇删除或简单的去噪策略上,以实现鲁棒性认证。然而,这些方法存在两个关键限制:
- 由于缺乏对扰动输出的语义验证,它们导致了松散的鲁棒性界限。
- 由于重复采样,计算成本较高。
为了解决这些限制,我们提出了CluCERT,一个通过聚类引导去噪平滑来认证LLM鲁棒性的全新框架。具体而言,为了实现更紧密的认证界限,我们引入了一种语义聚类过滤器,该过滤器减少了噪声样本并保留有意义的扰动,这一过程得到了理论分析的支持。
此外,我们通过两个机制提高了计算效率:
- 提炼模块:提取核心语义。
- 快速同义词替换策略:加速去噪过程。
最后,我们在各种下游任务和越狱防御场景中进行了广泛的实验。实验结果表明,我们的方法在鲁棒性界限和计算效率上均优于现有认证方法。
博主点评: CluCERT的提出为大语言模型的鲁棒性认证提供了新思路,通过聚类引导的去噪平滑有效地解决了现有方法的局限性。其在理论与实践上的双重支持,预示着未来对抗攻击防御领域的研究将更加深入,值得关注。