大型语言模型(LLM)在多轮对话中容易受到逐步操纵上下文的 jailbreak 攻击。现有的认证鲁棒性方法仅适用于单轮输入,直接将其在多轮上相乘会导致界限随轮数呈指数衰减。为此我们提出多轮认证鲁棒性(MTCR)框架,将对话安全建模为状态对抗马尔可夫决策过程(State‑Adversarial MDP),并将 $k$ 轮认证鲁棒性定义为 $k$ 个对抗轮次下的最坏安全概率。
MTCR 的核心贡献包括:
- 通过嵌入空间模式分解实现组合认证,得到的下界明显紧于朴素乘积。
- 引入 $(\alpha,\beta)$‑安全持久性,将衰减率从 $\underline{p}^{k}$ 改进为 $\beta^{k}$(其中 $\beta \underline{p}$),并提供可解释的安全时域估计。
- 给出信息论上匹配的上界,证明所得到的下界是紧的。
- 设计统一算法,将上述理论结果高效结合。
在六种主流 LLM 上,针对 $\epsilon$‑限制和 Crescendo 风格的攻击进行实验,结果显示实际安全率始终高于认证下界,验证了 MTCR 的有效性。
博主点评:该工作在多轮对话安全领域提供了系统的理论工具,尤其是安全持久性的概念,为实际部署提供了可量化的安全保障。