NeFut Logo NeFut
EN 管理员登录

[AI学术] 通过执行轨迹解释 AI 代理

发布于:2026-09-10 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #LLM

AI 代理正被广泛部署在真实环境中,需要与外部工具交互并在有限的人类监督下做出连续决策。这种场景对可审计、可靠的解释提出了迫切需求。传统的可解释人工智能(XAI)方法主要关注模型输出层面的解释,难以提供交互式、多步骤系统所需的过程级透明度。为此,我们提出了一种事后 XAI 框架,能够将冗长的代理执行轨迹转换为结构化报告,并生成基于可观测行为的忠实自然语言解释。该框架仅依赖执行轨迹,因而可适用于不同的代理架构、环境和任务。我们在多个基准和架构上进行人工与自动评估,结果表明框架能够生成高质量、轨迹忠实的解释,并能够可靠地识别不支持的声明、无正当理由的行为以及证据缺口,整体性能优于直接使用大语言模型生成的解释。

点评

原文链接: https://arxiv.org/abs/2609.06063

[h] 返回首页