鲁棒反事实解释(Robust Counterfactual Explanations, CFE)承诺在模型发生变化后仍能提供可行的补救措施。然而,这一承诺的实现取决于模型变化的具体形式。参数的微小扰动、在新数据上重新训练以及更换模型架构是截然不同的事件,而现有方法往往只针对其设计时所假设的单一变化进行评估,导致报告的鲁棒性分数对应不同的问题,难以直接比较。
为了解决此问题,我们提出了一套统一的跨族评估协议。该协议固定事实实例和生成的反事实,对八种常见的模型变化(包括参数扰动、bootstrap 再训练、架构替换等)统一进行测试,从而在同一基准上比较不同方法的表现。
实验使用四个表格数据集,比较了六种鲁棒 CFE 方法和两种标准基线。我们通过模型输出的变化来刻画每一次模型修改,并报告经验鲁棒性、覆盖率、基础有效性以及接近度等指标。
实验结果表明,不同变化族之间的相对性能和失效模式差异显著。参数微扰平均只改变 $0.95\%$ 的测试预测,而 bootstrap 再训练则导致约 $4.9\%$ 的预测变化。针对参数扰动提供理论保证的方法并不一定能迁移到其他类型的变化上。
在所有实验中,RobX 的鲁棒性最为一致,但要实现更高的稳定性往往需要更大的干预力度。
我们主张,鲁棒 CFE 方法的评估应采用统一协议,明确模型变化的类型、量化其实际行为幅度,并将生成性能与鲁棒性评估分离。
点评