在这项研究中,我们探讨了哪些语言模型规避攻击能够在最先进的对抗性微调下存活,开发出在ELOQUENT 2026 Voight-Kampff排行榜上占据前五的策略。
虽然对抗性微调轻松关闭了2025年获胜的规避策略,但我们发现了检测器脆弱性的基本不对称性:将生成的文本推离检测器的训练分布可以可靠地击败对抗检测,而将其拉入分布(例如,模仿人类训练数据)则完全失败。
利用这一点,我们引入了两种新颖的分布外攻击家族——跨十年注册攻击和现代主义意识流形式。这两种策略轻松绕过对抗性封闭,达到比以前方法高出约50倍的欺骗率,同时保持文本的自然性。
此外,实验表明,明显的反制措施(用时期散文增强训练数据)并未能关闭这一脆弱性。我们的发现表明,经过对抗性微调的检测器家族在结构性分布外变化下表现出持续的脆弱性,这一机制直接推动了我们在比赛中的领先表现。
博主点评: 本文揭示了AI文本生成与检测之间的复杂斗争,强调了对抗性微调的局限性及其在检测器脆弱性方面的意外发现。这一研究为未来的AI写作和检测技术提供了重要的启示,值得深入关注。