NeFut Logo NeFut
EN 管理员登录

[AI学术] 理解语义安全约束的局限性:为什么学习问题的不变量不能保证安全

发布于:2026-08-13 22:00 最后更新:2026-08-14 00:05
#AI #Machine Learning #LLM #Artificial Intelligence

最近的研究表明,语义安全约束(例如,智能体不逃离沙盒)是.off-support 对象。形式上,如果 $q$ 是数据分布,$p(cdotmid w)$ 是模型,安全谓词 $B$ 不是可测的关于 $sigma( ext{model}, q)$,而现实的对数正典门槛(RLCT)是。从这个非不变性,我们可以推导出几个结论:

原文链接: https://arxiv.org/abs/2608.11243

[h] 返回首页