摘要
视觉反事实解释旨在回答“对这张图像进行什么最小改动会改变模型的预测?”这一问题。随着视觉模型在安全关键领域(如医学)的应用,这一技术日益重要。现有的基于扩散的方法能够生成逼真的编辑,但依赖于外部分类器,这些分类器必须在噪声图像上可靠工作,这使得它们脆弱且难以在稳健解释中部署。
我们引入了C-VCE,一种新的扩散框架,它通过概念瓶颈层将分类器直接构建到生成模型中,使得反事实由人类可解释的特征(概念)引导,而不是依赖于与像素级编辑配合的单独噪声稳健分类器。我们的模型允许用户在采样过程中启用/禁用语义概念,然后最小调整相关图像区域,同时保留图像的其余部分,尊重特征相关性。
为了保持编辑的小幅度和可控性,我们添加了一个简单的概率正则化器,该正则化器在“改变预测”和“保持接近原始”之间进行平衡,并结合基于梯度的掩模,将修改限制在最相关的区域。在CelebA等基准测试上,C-VCE的翻转率与基于单独噪声图像分类器的基线相比相匹配或改进,同时生成的反事实在视觉上更接近输入,失真更少。这些特性使得C-VCE成为视觉系统中一种实用工具,用户无需依赖额外的噪声稳健分类器即可获得具体的“假设”图像。更广泛地说,我们的结果表明,暴露和控制内部概念层是一种使强大生成模型更易于理解和更安全使用的有希望的方法。
博主点评: C-VCE模型通过将概念层融入生成过程中,显著提高了反事实解释的可靠性和可控性。这一创新不仅为视觉AI的应用提供了更大的安全性,也为模型的可解释性开辟了新的方向,值得在多个领域推广应用。