我们观察到,目前可解释人工智能(XAI)领域的算法研究大多围绕若干代理指标展开,追求在这些指标上的更高分数。然而,这些代理指标本身存在缺陷,难以真实衡量方法的质量;同时,过度关注指标导致研究者忽视方法本身的合理性与可解释性。于是出现了对XAI方法本身进行可解释性研究的需求,本文将其戏称为XXAI,并将本工作定位为XXAI的实践之一。
本文以广泛使用的通用注意力模型可解释性方法(GAE)为研究对象,系统剖析其真实工作机制并指出其内在缺陷。GAE 本质上是一种关注注意力过程的解释手段,但其实现依赖于对注意力权重的直接解读,忽略了注意力在Transformer内部的累积效应以及特征交互的非线性特征,因而在复杂任务和含有特殊标记的模型上表现出解释偏差。
基于上述分析,本文提出累计资产持有(Cumulative Asset Holdings,CAH)方法。CAH 将过程式解释与特征式解释相结合,借鉴零和博弈的经济视角,将每一次注意力更新视为资产的转移,并通过累计持有量来衡量输入对输出的贡献。该框架自然兼容含有特殊token的模型,克服了现有方法在处理CLS、SEP等标记时的局限。
此外,本文采用模型简化研究方法和对Transformer中加法操作的分析,展示了如何通过拆解网络结构来揭示解释方法的本质,这一思路可为其他XAI研究提供参考。
点评