随着大语言模型代理的快速普及,理解和诊断其失效对提升系统效能和可信度至关重要。代理失效往往表现为冗长且复杂的轨迹,人工逐帧查找几乎不可能。
传统的软件缺陷诊断方法难以直接迁移到 LLM 代理,完全依赖 LLM 本身进行判断又缺乏可靠性。
为此,本文提出 AGENTSCOPE,一种神经符号混合的诊断框架。核心思想是依据轨迹将代理行为抽象为结构化表示,并引入神经不变式来形式化行为属性。
在结构化表示之上,AGENTSCOPE 通过 LLM 引导的推理与神经不变式对比,定位出轨迹中的失效步骤及其类型。
实验在公开的 Who&When 数据集以及作者自行构建的 AgentErrata 数据集上进行,AGENTSCOPE 在故障定位和归因准确率上显著超越现有最先进方法。
结果表明,将结构化抽象与 LLM 推理相结合能够实现对代理失效的高效、可靠且可解释的诊断。
点评