潜意识学习指语言模型在训练数据中捕获与行为特征无明显语义关联的信息,从而削弱基于内容的过滤安全措施。数据归因通过定位导致特定模型行为的训练样本,独立于语义内容,理论上可以在语义检查失效时发挥作用。我们在三种模型上评估了三种基于梯度的归因方法:GradCos、其对比变体以及 EK‑FAC,并将结果与已知的强基线——divergence tokens(需要对照教师模型)进行比较。
在令牌层面的过滤实验中,EK‑FAC 能显著削弱潜意识学习的影响,其他方法收益有限,且整体仍不及 divergence tokens。对完整样本的过滤效果更差,尽管在某些设置下 EK‑FAC 的信号仍强于 divergence tokens。不同方法在不同模型‑偏好组合上的表现差异显著,且未找到统一的解释。
结论是,梯度归因在部分情形下能够识别导致潜意识学习的数据,但其可靠性取决于具体的近似方法,且并非普遍适用。
点评