NeFut Logo NeFut
EN 管理员登录

[AI学术] 揭示可解释人工智能的本地加性特征归因:数学分类与报告清单

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:24
#AI #Machine Learning #Artificial Intelligence

特征归因方法是可解释人工智能的核心。这些方法的假设以多种数学语言表达,包括合作博弈值、路径积分、梯度算子、扰动分布和反向传播规则。本文提出了一个本地加性特征归因的共同框架,围绕五个规范选择组织了Shapley方法、基于路径的方法、梯度/反向传播方法、扰动方法和CAM风格的方法:

  1. 价值函数
  2. 参考
  3. 路径
  4. 扰动分布
  5. 守恒规则

接着,通过一个公理-方法矩阵比较了这些方法,并将一些常见的失效模式(包括基线敏感性、离散扰动、合理性检查失败、对抗性操控和方法不一致性)与产生这些失效模式的假设联系起来。最后,本文提出了一份包含十项的报告清单,供使用本地加性归因的研究参考。中心信息是,归因结果只有在相应的数学假设下才有意义,而这些假设应当被报告。

博主点评: 本文为可解释人工智能领域提供了系统性的分析,强调了归因方法的数学基础及其对结果的影响。通过规范化的框架,研究者可以更清晰地理解和比较不同归因方法的优缺点,促进更透明的研究实践。

原文链接: https://arxiv.org/abs/2607.14271

[h] 返回首页