训练无关的安全防护常通过可复用的安全信号(如不安全方向或全局有毒子空间)在所有提示上统一施加。我们对这种全局不安全假设进行几何控制分析,发现了一个一致的覆盖‑选择性权衡:紧凑的不安全子空间难以覆盖语义多样的不安全内容,而更宽泛的子空间会对安全相邻的良性提示产生显著失真。基于此观察,我们提出 CALM(Counterfactual Adaptive Local Modulation),它用提示局部的反事实校正取代统一的全局剔除。CALM 首先利用匹配的不安全‑良性锚点将每个提示路由到活跃的不安全类别,然后仅对违规的 token 表征进行最小幅度的安全侧编辑,并抑制与安全方向正向对齐的残余不安全分量。大规模实验表明,CALM 在显著降低不安全内容的同时,几乎不损失良性提示的实用性,验证了局部反事实校正相较于全局信号移除的更高选择性。
点评