Guardrail 模型是用于筛选 LLM 服务中恶意提示和响应的分类器。为满足低延迟要求,许多轻量级守护模型采用紧凑的 Transformer 主干(如 DeBERTa),在短上下文窗口(通常 512 token)上训练,并使用分桶相对位置编码来处理更长的输入。此前的评估默认,随着输入长度增加,守护模型的决策保持稳定。我们发现这一假设并不总成立。
我们提出 Overflip——一种由重复引发的不稳定现象:当提示被重复多次并使序列长度增长时,守护模型的预测会从恶意 (MAL) 翻转为良性 (BEN)。在 9 种主流轻量级守护模型上进行实验,5 种模型在 100 条基准提示中出现了 MAL$\to$BEN 翻转,置信度差距随重复次数逐步收窄。受影响模型的翻转率介于 8% 到 92% 之间,首次翻转大约在 2.6k–9.4k token 处出现。
进一步分析表明,Overflip 与传统的注意力稀释(attention‑dilution)方法不同。后者通过填充或随机打乱等手段将注意力从恶意 token 转移到无关内容;而 Overflip 保留恶意内容,却在重复结构上使 token‑级注意力趋于均匀,呈现出比填充更缓慢、更渐进的注意力分散轨迹。
由于被绕过的提示在语义上保持完整,仍能被下游业务 LLM 正确理解并执行恶意意图,Overflip 对 LLM 服务的威胁甚至超过传统的注意力稀释攻击。因此,重复本身构成了守护模型的潜在攻击面,亟需进行长度鲁棒性评估并研发相应的缓解措施。
点评