近年来,机器学习模型在高风险领域得到广泛应用,但其内部机制对使用者仍然不透明。传统的事后解释方法需要专家级的技能:在高维输出中定位关键信息、挑选最合适的解释方式、并在不同工具之间整合证据。为此我们提出 MEA,一个多智能体框架,旨在彻底消除解释知识的门槛。
ME A 由两个核心代理组成:Proposer 根据用户提问的类型和数据模态(表格、文本、视觉)自动选择并配置合适的解释工具;Actor 在端到端训练中以忠实度(faithfulness)为奖励进行优化,将工具输出转化为自然语言解释,直接对应模型行为。
我们设计了三类问题:特征归因、反事实推理和伪特征检测,并为每类提供基于扰动的忠实度度量。实验表明,最先进的 LLM 在未经约束的情况下往往生成不忠实的解释。通过在奖励中加入模态自适应惩罚,MEA 在六个数据集上持续超越传统事后解释器、基于代理的系统以及闭源基线,忠实度提升分别为 +28%(表格)、+21%(文本)、+34%(视觉),相较未训练的骨干网络有显著增益。
更广泛的意义在于,AI 代理本身可以成为可扩展、可适配的机器学习可解释性接口,为自然语言解释打开了超越单一工具的全新路径。
点评