NeFut Logo NeFut
EN 管理员登录

[AI学术] 保持冷静:文本到图像生成中的全局不安全性界限分析

发布于:2026-10-05 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #LLM

训练无关的安全防护常通过可复用的安全信号(如不安全方向或全局有毒子空间)在所有提示上统一施加。我们对这种全局不安全假设进行几何控制分析,发现了一个一致的覆盖‑选择性权衡:紧凑的不安全子空间难以覆盖语义多样的不安全内容,而更宽泛的子空间会对安全相邻的良性提示产生显著失真。基于此观察,我们提出 CALM(Counterfactual Adaptive Local Modulation),它用提示局部的反事实校正取代统一的全局剔除。CALM 首先利用匹配的不安全‑良性锚点将每个提示路由到活跃的不安全类别,然后仅对违规的 token 表征进行最小幅度的安全侧编辑,并抑制与安全方向正向对齐的残余不安全分量。大规模实验表明,CALM 在显著降低不安全内容的同时,几乎不损失良性提示的实用性,验证了局部反事实校正相较于全局信号移除的更高选择性。

点评

原文链接: https://arxiv.org/abs/2610.02300

[h] 返回首页