NeFut Logo NeFut
EN 管理员登录

[AI学术] 面向有效性的大型语言模型 Jailbreak 评估方法

发布于:2026-09-02 22:00 最后更新:2026-09-03 02:56
#AI #Machine Learning #LLM

Jailbreak 鲁棒性已成为大语言模型安全评估的核心,但现有方法主要依赖拒绝行为、语义相似性和意图匹配等启发式,侧重语言表面而非答案正确性。我们发现一个关键缺陷:多数 jailbreak 意图关注指令的有效性而非认知事实性,导致外观合理的回复即被标记为成功,即使在事实或步骤上错误。为弥补这一缺口,本文提出顺序认知与动作层验证(SEAV),一种以验证为中心的 jailbreak 评估框架。SEAV 将模型输出拆解为有序步骤,分别评估其有效性和正确性。框架结合 LLM‑as‑judge 进行语义解析,并利用检索式外部知识进行事实校验,检查生成内容是否事实准确、结构一致、并能实际推进有害目标。实验表明,SEAV 在 SD‑A(精选的策略性不诚实诊断)上将误报率降低 $14.9\text{pp}$,相较最强基线提升显著;在四个公开基准中,重新标记了 $22.1\%$–$51.0\%$ 的先前成功样本为无效。结果表明,加入正确性约束会显著改变鲁棒性度量:大量原本标记为 jailbreak 成功的案例被重新认定为无效,且在不同搜索后端和评估模型下结果保持稳定。代码与数据已开源:https://github.com/Ardor-Wu/SEAV

点评:通过引入事实与操作层面的验证,SEAV 有效削减了误判,提供了更可信的安全评估基准。

原文链接: https://arxiv.org/abs/2609.00498

[h] 返回首页