NeFut Logo NeFut
EN 管理员登录

[AI学术] 开源文本LLM水印:抵御模型合并的持久性新突破

发布于:2026-07-25 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #Open Source

在开源大型语言模型(OSMs)中,文本生成的水印技术正逐渐达到接近最先进的性能。传统方法通过将水印算法嵌入模型权重中来追踪生成的文本。然而,OSMs在训练后会经历修改,尤其是模型合并,这一过程通常会导致水印的丢失。

本研究首次提出了一种设计OSM水印的方法,使其在模型合并后依然持久。我们引入了合并对抗训练(Merge-Adversarial Training),这是一种对抗训练算法,能够将文本水印蒸馏到模型权重中,同时保持对后续模型合并的鲁棒性。

我们的实验表明,该方法在所有基准测试中均表现优异。例如,在SLERP场景下,TPR@1%FPR提升了51个百分点,平均提升25个百分点,同时保持了下游任务的能力。此外,我们首次将OSM水印在现实合并场景中进行评估,涵盖结合专家能力和防止灾难性遗忘等常见用例,测试了三种主要的合并算法。

更广泛地说,我们的研究结果表明,对抗训练是一种可靠的方法,可以增强OSM水印对训练后修改的耐久性。

博主点评: 本文提出的合并对抗训练为开源LLM的水印技术提供了新的思路,尤其在模型合并这一常见挑战中展现出强大的鲁棒性,值得关注和进一步研究。此方法不仅提升了水印的有效性,也为后续的模型应用提供了安全保障。

原文链接: https://arxiv.org/abs/2607.20435

[h] 返回首页