机器学习系统越来越需要从整个数据域(如有害语言、错误行为或特定主题)中移除影响,而不是单条记录。
该问题被形式化为分布式消除:在忘记域中挑选子集,使得删除后训练分布远离不想要的人群,同时保持与期望人群的接近。现有方法多依赖参数化假设,难以适用于高维语言模型表示。
我们提出 Mamushi 框架,实现非参数化分布式消除。框架使用一个概率分类器,对每个样本给出分数,其 Bayes 最优对数输出等于忘记‑保留对数密度比(加上常数类先验):$$\text{logit}(x)=\log\frac{p_{\text{forget}}(x)}{p_{\text{retain}}(x)}+\log\frac{\pi_f}{\pi_r}$$
对该对数密度比进行阈值化即可得到在固定预算下的最优选择规则。我们进一步给出非渐近转移保证,将分数估计误差和阈值校准误差与相对于总体最优规则的性能下降联系起来。
实验覆盖真实数据集的有害语言移除和主题域移除任务,使用多种表示方式。结果表明,Mamushi 在删除‑保留权衡上优于其他基线,并能在达到固定遗忘目标时显著降低所需的忘记样本数量。
点评