NeFut Logo NeFut
EN 管理员登录

[AI学术] 神经化追踪:使用对比稀疏自编码器的选择性表示层忘记

发布于:2026-09-28 22:00 最后更新:2026-09-30 01:41
#algorithm #AI #Machine Learning

机器忘记(Machine Unlearning)旨在删除特定信息,同时保持模型的其他能力。实际场景中,例如欧盟 GDPR 的隐私请求,目标往往非常细粒度——可能只涉及单个用户的行为数据。仅靠行为层面的遗忘往往不足,需要直接作用于模型内部表征。传统的机制可解释性提取器在针对这类细粒度目标时选择性差,主要因为基于重构的提取存在能量偏置:它倾向于保留占主导的背景结构,而忽视能量较低的目标特征。为此我们提出 SCALPEL(Contrastive Sparse Autoencoder),通过对比学习强制自编码器学习更具选择性的忘记特征。理论上,对比训练能够放大目标相关特征的信号,且我们定义的选择分数能够控制对背景知识的预期扰动。实验在 TOFU 基准上对 Qwen、Llama、Gemma 三大模型进行验证,SCALPEL 在忘记效果上显著优于 NMF 与标准 SAE 方法,并且在与 Gradient Difference、RMU 的对比中保持竞争力,实现了机制可解释性与细粒度忘记的桥接。

点评

原文链接: https://arxiv.org/abs/2609.31056

[h] 返回首页