最近的研究表明,语义安全约束(例如,智能体不逃离沙盒)是.off-support 对象。形式上,如果 $q$ 是数据分布,$p(cdotmid w)$ 是模型,安全谓词 $B$ 不是可测的关于 $sigma( ext{model}, q)$,而现实的对数正典门槛(RLCT)是。从这个非不变性,我们可以推导出几个结论:
- 为什么基于结果的优化会导致奖励黑客和沙盒逃逸;
- 为什么通过贝叶斯先验设计或软惩罚权重来编码这些约束在奇异模型中效果不佳;
- 为什么硬不变量应该属于控制器,而软性质应该属于模型;
- 为什么相同的 $B$ 却可以通过形式验证来局部地证明是正确的,就像局部学习系数(LLC)局部地固定相同的 RLCT 一样;
- 为什么残余困难,即确定哪个 off-support 区域很重要,等同于执行预测和自我参照功能动态,在那里奇异学习理论(SLT)的分析机制失效。我们使用 2026 年 7 月的 OpenAI-Hugging Face 评估事件作为一个实例。相关的数值实验代码和证明可以在 https://github.com/xiangze/Preventing_Jailbreak_as_regularization 找到。 博主点评: 本文揭示了语义安全约束的局限性,强调了在学习问题中不能仅仅依赖于这些约束来保证安全。相反,需要通过形式验证和其他方法来确保智能体的安全性和可靠性。