特征归因方法是可解释人工智能的核心。这些方法的假设以多种数学语言表达,包括合作博弈值、路径积分、梯度算子、扰动分布和反向传播规则。本文提出了一个本地加性特征归因的共同框架,围绕五个规范选择组织了Shapley方法、基于路径的方法、梯度/反向传播方法、扰动方法和CAM风格的方法:
- 价值函数
- 参考
- 路径
- 扰动分布
- 守恒规则
接着,通过一个公理-方法矩阵比较了这些方法,并将一些常见的失效模式(包括基线敏感性、离散扰动、合理性检查失败、对抗性操控和方法不一致性)与产生这些失效模式的假设联系起来。最后,本文提出了一份包含十项的报告清单,供使用本地加性归因的研究参考。中心信息是,归因结果只有在相应的数学假设下才有意义,而这些假设应当被报告。
博主点评: 本文为可解释人工智能领域提供了系统性的分析,强调了归因方法的数学基础及其对结果的影响。通过规范化的框架,研究者可以更清晰地理解和比较不同归因方法的优缺点,促进更透明的研究实践。