在这项研究中,我们探讨了经过微调的大型语言模型(LLMs)如何通过隐写通道秘密地编码提示信息。以往的研究显示了这一威胁,但其依赖于可轻易恢复的编码。我们通过分类器准确率形式化了有效载荷恢复能力,并指出之前的方案实现了100%的恢复率。为了应对这一现象,我们引入了低恢复率的隐写术,通过用嵌入空间派生的映射替代任意映射。
针对 Llama-8B(LoRA)和 Ministral-8B(LoRA),在 TrojanStego 提示下,确切的秘密恢复率分别从17%提升至30%(+78%)和从24%提升至43%(+80%)。而在 Llama-70B(LoRA)上,使用维基百科提示时,恢复率则从9%提升至19%(+123%),同时降低了有效载荷的恢复能力。
关于检测,我们认为检测基于微调的隐写攻击需要超越传统隐写分析的方法。标准方法测量分布偏移,这通常是微调的预期副作用。相反,我们提出了一种机械可解释性的方法:在后层激活上训练的线性探针能够以高达33%的准确率检测微调模型中的秘密,甚至在低恢复率方案中也表现不俗。这表明恶意微调留下了可操作的内部特征,适合基于可解释性的防御策略。
博主点评: 本文提出了低恢复率隐写术的创新方案,显著提高了隐写信息的隐蔽性。同时,利用机械可解释性的方法进行检测,为防御微调攻击提供了新的思路,展示了模型内部特征的潜力。此研究为LLM的安全性提供了重要的参考,值得深入探讨。