在大型语言模型(LLMs)中,后门攻击是一种潜在的威胁,攻击者通过隐藏触发器诱导恶意输出。现有的防御措施通常分为推理时检测和训练时缓解,但存在两个主要局限性:
首先,它们主要集中在基于微调的后门(如PEFT模块),无法有效应对绕过训练流程的隐蔽模型编辑攻击。其次,它们主要针对简单的分类任务,无法自然扩展到LLMs的开放式生成特性。
因此,这些方法往往只关注表面行为模式,而忽视了恶意激活的深层表征原因。缺乏这种机制理解使得防御措施依赖于经验启发式,限制了它们在真实世界LLM部署中的鲁棒性、通用性和实用性。
为了解决这些问题,我们提出了DeCNIP(通过关键神经元隔离修剪进行防御),该方法利用表征分析来识别和中和后门攻击。具体而言,DeCNIP通过优化有害提示与候选标记和良性输入之间的交叉熵损失来识别触发器行为。
这种表征发现揭示了潜在威胁,揭示了触发器如何劫持模型权重的机制。随后,它隔离后门关键神经元(BCNs),并选择性地修剪它们,以消除恶意影响,同时保持模型的实用性。
在六个开源LLM和两个基准数据集上进行的广泛评估表明,DeCNIP在攻击成功率(ASR)方面实现了超过95%的相对降低,超越了七种最先进的防御方法,仅需0.1%的神经元干预。此外,它在正常基准测试中保持了97%的模型性能,展示了其有效性、鲁棒性和可扩展性。
博主点评: DeCNIP的提出为解决LLM后门攻击提供了新的思路,通过关键神经元的精准隔离与修剪,有效提升了模型的安全性和实用性。这种方法不仅具备强大的理论基础,还在实际应用中展现出优越的性能,是未来LLM防护研究的重要方向。