NeFut Logo NeFut
EN 管理员登录

[AI学术] MLCommons 越狱基准 v1.0

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

现代 AI 系统会拒绝危险请求。越狱提示通过特制的指令绕过安全防护,诱导模型输出本应拒绝的内容。MLCommons 越狱基准 v1.0 提出了一套端到端的方法,用于评估大语言模型在单轮文本越狱攻击下的鲁棒性。该方法包括依据标准挑选系统和攻击、基线与对抗评估、人工标注、自动评估器校准、得分、分级以及风险校准的结果披露,形成完整的基准流水线。

基准对八个开源模型进行测试,使用 264 条种子提示,覆盖十一类危害,并从 MLCommons 越狱分类中抽取代表性攻击。响应采用 AILuminate Assessment Standard v1.4 进行评估,鲁棒性通过“韧性差距”衡量,即基线安全性能与对抗条件下的差异。

实验显示,所有模型在基线下的非安全响应率为 11.08%,在越狱条件下升至 18.65%,平均韧性差距为 7.57%。可访问模型的差距更大,不同攻击类别和危害的效果差异显著。基准还分析了评估者可靠性和测量误差来源。

除了报告结果,越狱基准 v1.0 为可复现的比较评估提供了方法基础,并支持未来在模型、攻击、危害和评估方式上的扩展。

点评

原文链接: https://arxiv.org/abs/2610.02827

[h] 返回首页