NeFut Logo NeFut
EN 管理员登录

[AI学术] 通过零空间投影对 LoRA 调优的 LLM 进行后门净化

发布于:2026-10-02 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

随着大语言模型(LLM)和参数高效微调(PEFT)方法的广泛落地,后门攻击的风险显著提升。现有的后门净化手段往往依赖触发词先验、干净参考数据或大规模再训练等强假设,且评估不够全面,导致实际部署受限。\ \ 本文提出一种无需上述假设、亦不需要对可疑参数进行事后再训练的 LoRA‑tuned LLM 净化方案。目标是在大幅降低攻击成功率(ASR)的同时,保持 (i) 基础模型的通用能力和 (ii) 适配器在下游任务中学到的新技能。\ \ 核心思路包括:通过精心挑选的数据和特征近似,提取高保真度的后门方向;对每一层或每个注意力头的输入、输出通道分别构造正交的零空间;随后将 LoRA 更新投影到这些零空间上,从而消除潜在的后门信息。\ \ 我们在文本分类的单层实验到全参数生成任务的完整 LLM 上进行了一系列消融研究,验证了方法的可扩展性。实验表明,零空间投影能够将 ASR 从接近 100% 降至低于 10%,同时几乎不影响基模型的正常性能和适配器的下游任务表现。\ \ 该工作展示了在不破坏模型功能前提下,利用线性代数工具对 LoRA 参数进行安全清洗的可行路径。\ \ 点评

原文链接: https://arxiv.org/abs/2610.00685

[h] 返回首页