NeFut Logo NeFut
EN 管理员登录

[AI学术] 大型语言模型的脆弱场景:揭示潜在安全隐患

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#AI #Machine Learning #Open Source

摘要

安全对齐的大型语言模型经过训练以拒绝有害请求,但在特定场景中嵌入相同请求可以绕过其保护措施。现有的红队方法通过观察攻击结果实证识别有效场景,但为何特定场景削弱拒绝机制的原因仍然机制上不清晰。同时,机制可解释性研究已经表征了拒绝方向和越狱相关特征,但未解释这两种表征之间的关系。

在本研究中,我们展示了场景包装的提示激活了内部场景方向,其因果引导持续降低拒绝分数。基于这一发现,我们提出了 \textsc{Concept2Scenario},一个基于概念的脆弱场景发现框架。该框架通过稀疏自编码器实例化广泛的概念空间,将拒绝抑制归因于个体概念,翻译识别的概念为可解释的自然语言场景,并通过交互归因识别协同场景组合。

在三个开源模型、两个安全基准和六种黑箱越狱方法中,发现的场景作为可重用的先验,平均攻击成功率提高了多达 $18.2$ 个百分点。这些场景还可迁移至 GPT-5、Claude-Haiku-4.5 和 Gemini-3-Flash,表明某些场景级拒绝脆弱性在模型家族之间是共享的。此外,识别的组合优于其个体构成,并使迭代攻击在更少的回合中成功。

博主点评: 本文揭示了大型语言模型在安全性方面的脆弱性,提出的框架有效地识别并利用这些脆弱场景,具有重要的实际应用价值。随着AI技术的快速发展,理解并修复这些安全隐患将成为研究的重要方向。

原文链接: https://arxiv.org/abs/2607.23496

[h] 返回首页