NeFut Logo NeFut
EN 管理员登录

[AI学术] 通过组合界限和安全持久性实现 LLM 安全的多轮认证鲁棒性

发布于:2026-08-24 22:00 最后更新:2026-08-29 12:04
#AI #Machine Learning #LLM

大型语言模型(LLM)在多轮对话中容易受到逐步操纵上下文的 jailbreak 攻击。现有的认证鲁棒性方法仅适用于单轮输入,直接将其在多轮上相乘会导致界限随轮数呈指数衰减。为此我们提出多轮认证鲁棒性(MTCR)框架,将对话安全建模为状态对抗马尔可夫决策过程(State‑Adversarial MDP),并将 $k$ 轮认证鲁棒性定义为 $k$ 个对抗轮次下的最坏安全概率。

MTCR 的核心贡献包括:

  1. 通过嵌入空间模式分解实现组合认证,得到的下界明显紧于朴素乘积。
  2. 引入 $(\alpha,\beta)$‑安全持久性,将衰减率从 $\underline{p}^{k}$ 改进为 $\beta^{k}$(其中 $\beta \underline{p}$),并提供可解释的安全时域估计。
  3. 给出信息论上匹配的上界,证明所得到的下界是紧的。
  4. 设计统一算法,将上述理论结果高效结合。

在六种主流 LLM 上,针对 $\epsilon$‑限制和 Crescendo 风格的攻击进行实验,结果显示实际安全率始终高于认证下界,验证了 MTCR 的有效性。

博主点评:该工作在多轮对话安全领域提供了系统的理论工具,尤其是安全持久性的概念,为实际部署提供了可量化的安全保障。

原文链接: https://arxiv.org/abs/2608.20820

[h] 返回首页