NeFut Logo NeFut
EN 管理员登录

[AI学术] Overflip:守护模型中的重复诱导标签翻转

发布于:2026-09-16 22:00 最后更新:2026-09-18 00:46
#AI #Machine Learning #LLM

Guardrail 模型是用于筛选 LLM 服务中恶意提示和响应的分类器。为满足低延迟要求,许多轻量级守护模型采用紧凑的 Transformer 主干(如 DeBERTa),在短上下文窗口(通常 512 token)上训练,并使用分桶相对位置编码来处理更长的输入。此前的评估默认,随着输入长度增加,守护模型的决策保持稳定。我们发现这一假设并不总成立。

我们提出 Overflip——一种由重复引发的不稳定现象:当提示被重复多次并使序列长度增长时,守护模型的预测会从恶意 (MAL) 翻转为良性 (BEN)。在 9 种主流轻量级守护模型上进行实验,5 种模型在 100 条基准提示中出现了 MAL$\to$BEN 翻转,置信度差距随重复次数逐步收窄。受影响模型的翻转率介于 8% 到 92% 之间,首次翻转大约在 2.6k–9.4k token 处出现。

进一步分析表明,Overflip 与传统的注意力稀释(attention‑dilution)方法不同。后者通过填充或随机打乱等手段将注意力从恶意 token 转移到无关内容;而 Overflip 保留恶意内容,却在重复结构上使 token‑级注意力趋于均匀,呈现出比填充更缓慢、更渐进的注意力分散轨迹。

由于被绕过的提示在语义上保持完整,仍能被下游业务 LLM 正确理解并执行恶意意图,Overflip 对 LLM 服务的威胁甚至超过传统的注意力稀释攻击。因此,重复本身构成了守护模型的潜在攻击面,亟需进行长度鲁棒性评估并研发相应的缓解措施。

点评

原文链接: https://arxiv.org/abs/2609.15013

[h] 返回首页