NeFut Logo NeFut
EN 管理员登录

[AI学术] T5-CSBoost:对抗性扰动抵抗的LLM指纹识别技术

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:24
#AI #Machine Learning #Open Source

在许多AI生成文本(AIGT)检测器在干净输入下表现强劲的同时,它们在轻微的改写、词语替换、字符编辑和分布转移下的准确性显著下降。

我们提出了T5对比风格增强分类器(T5-CSBoost),这是对T5-Sentinel框架的扩展,保留了用于源归属的原始下一个标记预测目标,同时引入了基于边际的三元组损失作为辅助损失,以优化解码器嵌入。

这种对比风格的正则化鼓励学习紧凑且抵抗扰动的风格表示,提供了一种轻量且有效的替代方案,而不改变基础的T5-small骨干网络。

T5-CSBoost在OpenLLMText和HC3 AIGT基准上实现了最先进的多类源归属和二分类人类与LLM检测。

更重要的是,T5-CSBoost在高达90%强度的单词和字符级对抗扰动下展示了增强的鲁棒性,在具有挑战性的MAGE/Deepfake压力测试套件上取得了最先进的成绩,包括未见模型、未见领域和极端改写场景。

我们的结果强调,通过对比学习显式正则化风格嵌入是一种在真实世界对抗环境中构建更鲁棒的LLM指纹识别系统的实用和有效策略。

博主点评: T5-CSBoost通过引入对比风格正则化,显著提升了对抗性扰动的抵抗能力,展示了在AI生成文本检测领域中的创新思路。这一方法不仅保持了原有模型的结构完整性,还为未来的LLM指纹识别提供了新的方向,值得深入研究和应用。

原文链接: https://arxiv.org/abs/2607.14113

[h] 返回首页