NeFut Logo NeFut
EN 管理员登录

[AI学术] 颠覆性防蒸馏技术:答案-编辑框架的推理骨架编辑

发布于:2026-07-25 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #optimization

摘要

专有的大型语言模型(LLMs)需要大量的知识和财务投资,因此它们是宝贵的知识产权(IP)。然而,即使通过黑盒API部署,这些模型仍然容易受到未经授权的知识蒸馏攻击,adversaries可以廉价提取和复制模型的能力。为了解决这个问题,提出了防蒸馏(AD)技术,旨在生成防御性输出,降低蒸馏的有效性,从而克服依赖事后验证的水印方法的局限性。

现有基于内部模型扰动的AD方法在防蒸馏能力与推理痕迹的实用性(如答案准确性和自然性)之间难以取得平衡,强大的防御往往会导致显著的实用性损失。为填补这一空白,我们提出了骨架引导推理编辑(SGRE),这是一个答案-编辑框架,执行后期推理痕迹修改以实现防蒸馏。

在答案阶段,教师模型首先生成干净的推理痕迹,保持原始推理的准确性,同时允许对痕迹自然性进行更灵活的控制。在编辑阶段,我们借鉴了认知负荷理论(CLT),引入了一个三阶段策略,包括推理骨架提取、骨架图简化和骨架语言化。这些操作共同扰动推理结构,增加文本复杂性,从而增强对学生模型的额外负荷,阻碍它们获取潜在的推理模式。

在不同的LLMs上进行的广泛实验表明,SGRE在降低蒸馏有效性方面达到了最先进的性能,同时保持无损的推理准确性和优越的痕迹自然性。

博主点评: SGRE框架通过创新的推理骨架编辑方法,在防蒸馏领域提供了有效的解决方案,保持了模型的实用性,同时增强了防御能力。这一研究不仅提升了对LLM的保护,也为未来的知识产权保护方法开辟了新路径。

原文链接: https://arxiv.org/abs/2607.20440

[h] 返回首页