轨迹评估是提升基于大语言模型(LLM)代理可靠性的关键环节,但在生产环境中频繁运行成本高昂。现代代理会生成包含工具调用、观察、重试以及外部输出的长序列,而并非所有原始 token 对诊断同等重要。为此我们提出 LiteTrajEval,一种在预算受限条件下进行轨迹评估的轻量化框架。
LiteTrajEval 首先在离线阶段为特定领域生成紧凑的规则画像,然后在在线阶段对每条轨迹进行预处理:标记启发式失败信号、在全局固定预算内序列化轨迹,并调用单一的基于评分标准的 LLM 判官生成结构化诊断报告。
在公开的 Magnetic‑One 风格和 $\tau$‑bench 风格轨迹数据集上进行评估,LiteTrajEval 将故障定位与人工标注的对齐度提升约 20%–35%(Magnetic‑One)和最高 23%($\tau$‑retail),相较于 AgentRx,成本降低约 6 倍,评估时长缩短超过 8 倍。该方案已在我们的企业级代理平台上线运行。
点评:LiteTrajEval 通过离线规则压缩与在线预算控制,实现了高效且可解释的轨迹诊断,为大规模部署 LLM 代理提供了实用的成本‑性能平衡方案。