大语言模型安全研究关注检测和防止 jailbreak 攻击,即对齐绕过,使对手能够诱导模型输出不期望或有害内容。
任意密码(covert communication)攻击是一种 jailbreak,之前在商业模型的微调 API 上演示过。攻击者先让模型在加密的有害问答语料上进行微调,使模型学会使用特定加密方案来回答有害请求。
本文发现最新的前沿模型无需微调即可掌握密码通信能力。只需通过精心设计的提示或在上下文中示例,即可让模型学习并使用加密方案。
当通信通过学习到的密码进行时,模型的对齐显著削弱甚至完全失效。攻击者可以绕过商业有害内容分类器,因为加密后的文本看起来是无意义的字符。
我们在 Anthropic、Google、OpenAI 的前沿模型上成功实现了此类 jailbreak,证明了对黑盒大模型的全新攻击向量。
该攻击利用了模型的强大语言理解和生成能力,在提示中嵌入加密映射,实现了无需额外训练的隐蔽通信。
点评