NeFut Logo NeFut
EN 管理员登录

[AI学术] ASCII 攻击:在大型语言模型中将有害请求重新语境化为艺术批评

发布于:2026-09-03 22:00 最后更新:2026-09-04 02:14
#AI #Machine Learning #LLM

安全对齐通常让大模型拒绝直接的有害请求,但这种训练主要针对表面形式。若把相同的操作内容重新语境化,模型的防御会变弱。ASCII 攻击就是一种重新语境化手段。它在单轮黑盒交互中,仅发送一条消息:把完整的有害请求用 ASCII 艺术字符呈现为“作品”,并请求模型给出艺术批评。请求本身仍可读,未被隐藏。模型的回复以艺术评论的形式出现,可能包含原本会被拒绝的操作细节。

实验中,每个框架化提示都配有一个直接提问的对照,以消除主题、模型和解码差异的影响。对照的差异仅来自提示的表面形式。使用十一种模型和八类危害主题,基于危害感知分类器的评估显示,框架化提示被判定为有害的比例为 62%,而对照仅为 42%。在最易受攻击的模型上,框架化提示的成功率高达 93%。单次查询的效果在四个危害评估指标中至少等同或超过已发表的单查询攻击。结果表明,危害程度更依赖模型本身而非具体话题,且随模型规模增大并未减弱。约有三分之二的框架化行出现至少一名评审与多数意见不一致,这本身揭示了测量有效性的限制,暗示模型的泛化存在不匹配。

点评

原文链接: https://arxiv.org/abs/2609.02215

[h] 返回首页