NeFut Logo NeFut
EN 管理员登录

[AI学术] 基于收缩约束状态空间模型的有界可达性与越狱检测

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#AI #LLM #Safety

安全检测头是附加在预训练语言模型上的轻量级分类器,用于在生成文本前标记潜在有害输入。已有大量实验评估其检测效果,但其形式化的鲁棒性仍未得到系统研究。本文关注基于状态空间模型(State Space Model, SSM)的安全检测头,探讨在嵌入空间的有界扰动范围内,是否能够保证检测头对所有输入给出相同的预测。我们证明,这一可证性仅取决于一个条件:状态转移矩阵 $A$ 的 $l_\infty$ 范数必须满足 $$\|A\|_\infty \le 1.$$ 当该不等式成立时,任何在嵌入空间内的 $\epsilon$-球内的扰动都不会改变安全检测头的输出,从而实现对越狱攻击的形式化防护。该结果为设计具备可验证安全性的语言模型提供了明确的数学准则。

点评

原文链接: https://arxiv.org/abs/2610.02853

[h] 返回首页