NeFut Logo NeFut
EN 管理员登录

[AI学术] 任意密码攻击对大型语言模型不需要微调

发布于:2026-09-12 22:00 最后更新:2026-09-15 01:15
#AI #Machine Learning #LLM

大语言模型安全研究关注检测和防止 jailbreak 攻击,即对齐绕过,使对手能够诱导模型输出不期望或有害内容。

任意密码(covert communication)攻击是一种 jailbreak,之前在商业模型的微调 API 上演示过。攻击者先让模型在加密的有害问答语料上进行微调,使模型学会使用特定加密方案来回答有害请求。

本文发现最新的前沿模型无需微调即可掌握密码通信能力。只需通过精心设计的提示或在上下文中示例,即可让模型学习并使用加密方案。

当通信通过学习到的密码进行时,模型的对齐显著削弱甚至完全失效。攻击者可以绕过商业有害内容分类器,因为加密后的文本看起来是无意义的字符。

我们在 Anthropic、Google、OpenAI 的前沿模型上成功实现了此类 jailbreak,证明了对黑盒大模型的全新攻击向量。

该攻击利用了模型的强大语言理解和生成能力,在提示中嵌入加密映射,实现了无需额外训练的隐蔽通信。

点评

原文链接: https://arxiv.org/abs/2609.09553

[h] 返回首页