机器消除(machine unlearning)旨在让 AI 模型忘记已学到的特定概念。近年来,生成式模型的消除技术取得快速进展,但在保留语义相关概念的同时避免意外退化(即干扰)仍缺乏系统化的描述和统一的评估方法。
I-CARE 将干扰提升为可独立研究的对象,提供了一套完整的任务定义、度量指标以及结果报告模板。该方法并不引入新的基准或特定的消除算法,而是通过形式化的框架,使研究者能够在不同的消除场景下可重复地测量干扰强度并进行横向比较。
框架的核心包括:
- 任务定义:明确待消除概念、保留概念以及评估数据的构造规则;
- 度量指标:基于生成质量、概念保留率和干扰度三个维度量化消除效果;
- 报告模板:统一的表格与可视化规范,确保结果可复现且易于对比。
为了验证 I-CARE 的可行性,作者在多个主流文本到图像模型上使用最新的消除算法(如差分隐私微调、逆向蒸馏等)以及常用数据集(COCO、LAION)进行实验。实验表明,I-CARE 能够捕捉到不同算法在不同概念组合下的干扰模式,揭示了某些消除策略会导致意外的语义漂移。
整个方法已在开源仓库中实现,并提供了基于网页的图形界面,用户无需直接操作代码或使用专业的数据分析工具即可探索实验结果。
点评