AI 代理正被广泛部署在真实环境中,需要与外部工具交互并在有限的人类监督下做出连续决策。这种场景对可审计、可靠的解释提出了迫切需求。传统的可解释人工智能(XAI)方法主要关注模型输出层面的解释,难以提供交互式、多步骤系统所需的过程级透明度。为此,我们提出了一种事后 XAI 框架,能够将冗长的代理执行轨迹转换为结构化报告,并生成基于可观测行为的忠实自然语言解释。该框架仅依赖执行轨迹,因而可适用于不同的代理架构、环境和任务。我们在多个基准和架构上进行人工与自动评估,结果表明框架能够生成高质量、轨迹忠实的解释,并能够可靠地识别不支持的声明、无正当理由的行为以及证据缺口,整体性能优于直接使用大语言模型生成的解释。
点评