NeFut Logo NeFut
EN 管理员登录

[AI学术] 嵌入空间中的隐秘与寻觅:基于几何的隐写术与大型语言模型的检测

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#LLM #Steganography #Mechanistic Interpretability

在这项研究中,我们探讨了经过微调的大型语言模型(LLMs)如何通过隐写通道秘密地编码提示信息。以往的研究显示了这一威胁,但其依赖于可轻易恢复的编码。我们通过分类器准确率形式化了有效载荷恢复能力,并指出之前的方案实现了100%的恢复率。为了应对这一现象,我们引入了低恢复率的隐写术,通过用嵌入空间派生的映射替代任意映射。

针对 Llama-8B(LoRA)和 Ministral-8B(LoRA),在 TrojanStego 提示下,确切的秘密恢复率分别从17%提升至30%(+78%)和从24%提升至43%(+80%)。而在 Llama-70B(LoRA)上,使用维基百科提示时,恢复率则从9%提升至19%(+123%),同时降低了有效载荷的恢复能力。

关于检测,我们认为检测基于微调的隐写攻击需要超越传统隐写分析的方法。标准方法测量分布偏移,这通常是微调的预期副作用。相反,我们提出了一种机械可解释性的方法:在后层激活上训练的线性探针能够以高达33%的准确率检测微调模型中的秘密,甚至在低恢复率方案中也表现不俗。这表明恶意微调留下了可操作的内部特征,适合基于可解释性的防御策略。

博主点评: 本文提出了低恢复率隐写术的创新方案,显著提高了隐写信息的隐蔽性。同时,利用机械可解释性的方法进行检测,为防御微调攻击提供了新的思路,展示了模型内部特征的潜力。此研究为LLM的安全性提供了重要的参考,值得深入探讨。

原文链接: https://arxiv.org/abs/2601.22818

[h] 返回首页