摘要
生产环境中的LLM应用通常在模型侧对齐前堆叠一个正则表达式过滤器;先前的研究发现,添加一个活跃的Gemini后端并不会带来可测量的覆盖率增益。我们探讨在语料库\textit{设计为绕过正则表达式}的情况下,这种上限是否依然成立。我们引入$L_5$-no-regex —— 其与$L_4$-real(Gemini-2.5-flash,令牌预算上限,速率限制,输出清理)相同,但禁用了九种模式过滤器,并在$N{=}45$个对抗性探测器上进行评估,涵盖三个子语料库(继续传递、绕过正则表达式、对齐隔离),通过Gemini同义句和PAIR放大至${\text{约}}1{,}555$个探测运行对,经过$N{=}5$次重复实验。在主要的子串分类器下,H1被推翻:$L_5$的阻塞率在所有五个OWASP LLM前10类别中均为$0\text{%}$($\text{pp}\triangle{=}0$对比$L_0$,$p{=}1.00$;Wilson上限...)
博主点评: 这项研究深入探讨了LLM模型在对齐与正则表达式过滤器之间的相互作用,揭示了在对抗性环境中这些机制的脆弱性。通过对专门设计的语料库进行测试,研究者们提供了重要的见解,值得在未来的应用中考虑。进一步的实验将有助于理解这些模型在实际应用中的表现。