现有的评估框架大多只关注 AI 代理的某一环节,例如仅测任务完成度(AgentBench)或仅测安全鲁棒性(AgentDojo、ASB),而忽视了规划、工具选择、工具执行、记忆与推理等完整流水线。任何阶段的失误都可能导致整体失败,但传统基准很少能定位具体的错误来源。AgentAudit 通过读取代理的执行轨迹,横跨十个维度——指令完整性、规划器、记忆、工具选择、工具调用、工具正确性、对齐、工具忠实度、安全性以及执行完整性——并结合行为分类与失效归因,精准指明导致错误的环节。该框架以“附着”方式接入任意基于大语言模型的 AI 代理,只需读取已记录的执行日志,不干预内部实现,从而对所有实现保持中立。我们在九个能力与对抗任务上对五种语言模型(OpenAI GPT‑5、Claude Sonnet 5、Sarvam 105B、Llama 3.3 70B、Gemini 2.5 Flash)进行评估。Claude Sonnet 5 与 GPT‑5 获得最高的综合信任分,分别为 95.1 与 80.6(满分 100),而 Sarvam 105B、Llama 3.3 70B 与 Gemini 2.5 Flash 的得分明显落后,分别为 57.6、45.7 与 22.6。所有轨迹均由同一固定的评审模型打分,而该评审模型本身也是被评测对象,这一局限在第 VII.E 节中讨论。更重要的是,行为相似的模型在信任度上可能出现巨大差异;若干非前沿模型在对抗任务中被标记为 Unsafe_Compliance,而不仅仅是失败,这类细粒度的安全评估是传统通过/不通过基准所无法捕获的。
点评