评估可解释人工智能(XAI)方法一直缺乏可靠的评估手段,尤其是缺少真实的解释真值。现有文献多采用与黑盒模型预测的一致性(fidelity)来衡量解释,但这种方式只能说明解释能否复现模型输出,无法保证解释真实反映模型的决策过程。因此,不同解释可能得到相似的 fidelity 分数,却给出相互冲突甚至误导的解释。
本文提出一种基于合成真值的 XAI 评估框架。核心思路是通过受控干预生成合成数据集,在数据生成阶段即可确定各输入特征的重要性,从而得到与模型行为严格对应的真值解释。该框架在二值图像、表格数据和时间序列三类数据上实现,覆盖了视觉、结构化和序列三种典型场景。
在实验中,我们选取了九种主流 XAI 方法(包括 Grad‑CAM、SHAP、LIME 等)进行评测。结果显示,当前多数方法在合成真值基准上表现出显著局限:有的只能捕捉到局部特征,有的在不同数据域上表现不一致,甚至出现完全错误的特征归因。
这些发现表明,仅凭 fidelity 评价不足以检验解释的真实性,合成、干预式的基准对于客观衡量解释质量至关重要。
点评:合成真值框架为 XAI 评估提供了可控、可重复的实验环境,揭示了现有解释方法在真实因果层面的不足,为后续算法改进指明了方向。