机器忘记(Machine Unlearning)旨在删除特定信息,同时保持模型的其他能力。实际场景中,例如欧盟 GDPR 的隐私请求,目标往往非常细粒度——可能只涉及单个用户的行为数据。仅靠行为层面的遗忘往往不足,需要直接作用于模型内部表征。传统的机制可解释性提取器在针对这类细粒度目标时选择性差,主要因为基于重构的提取存在能量偏置:它倾向于保留占主导的背景结构,而忽视能量较低的目标特征。为此我们提出 SCALPEL(Contrastive Sparse Autoencoder),通过对比学习强制自编码器学习更具选择性的忘记特征。理论上,对比训练能够放大目标相关特征的信号,且我们定义的选择分数能够控制对背景知识的预期扰动。实验在 TOFU 基准上对 Qwen、Llama、Gemma 三大模型进行验证,SCALPEL 在忘记效果上显著优于 NMF 与标准 SAE 方法,并且在与 Gradient Difference、RMU 的对比中保持竞争力,实现了机制可解释性与细粒度忘记的桥接。
点评