NeFut Logo NeFut
EN 管理员登录

[AI学术] HE-Guardrail:针对加密大语言模型推理的同态防护栏,抵御 Jailbreak 攻击

发布于:2026-09-22 22:00 最后更新:2026-09-24 00:40
#AI #LLM #Cryptographic

Homomorphic 加密(HE)已成为隐私保护机器学习(PPML)的重要手段,能够在密文上直接进行计算。 在 HE‑PPML 场景中,客户端将加密后的输入发送给服务器,服务器在不解密的情况下执行大语言模型(LLM)等模型。然而,这种设置存在严重的安全漏洞:恶意客户端可以提交对抗性提示(如 jailbreak 攻击),而服务器由于同态加密的保密性,既看不到原始提示,也看不到生成的响应,导致攻击难以检测或阻止,且成功攻击对服务器完全透明。 为了解决该问题,本文提出 HE‑Guardrail 框架,它在全密文域内评估防护机制,并同态地控制是否将模型响应返回给客户端。 我们基于三种代表性防护实现了 HE‑Guardrail:Llama Guard、JBShield 和 GradSafe。 实验表明,HE‑Guardrail 在加密域中能够高度复现相应明文防护的决策,同时在安全性、效率和实用性之间呈现不同的权衡。

点评

原文链接: https://arxiv.org/abs/2609.21484

[h] 返回首页