NeFut Logo NeFut
EN 管理员登录

[AI学术] AgentPProf:面向长期 AI 代理的语义分析器

发布于:2026-09-19 22:00 最后更新:2026-09-20 12:54
#AI #optimization #LLM

AI 代理正越来越多地与用户、工具和系统资源协同完成跨天甚至跨周的任务。为了提升代理的质量、安全性和成本效率,开发者需要定位失败点、识别触发不安全行为的原因,并找出消耗预算最多的任务,以便进行针对性优化。系统软件中的 profiling 通过聚合资源消耗并归因到具体代码路径来发现热点,但现有的代理可观测性工具主要关注单次执行的调试和追踪,缺乏跨运行、长期的 profiling 能力,导致上述问题难以在大规模上回答。

对代理进行 profiling 的难点在于:负责的实体是任务意图(如诊断身份验证、比较分支),而非传统的代码路径;且缺少稳定的标识符用于跨运行聚合。为此我们提出了语义操作栈模型,将所有活动抽象为统一的操作,并用操作栈取代运行时调用栈,从而在不同粒度上实现层次化归因。我们观察到,一个任务在轨迹中占据连续区间,并可进一步拆分为子任务,于是引入递归操作分段技术,在任务边界处递归切分轨迹。

AgentPProf 将代理轨迹聚合为 pprof 兼容的 profile,支持 flame graph 可视化与分析。实验表明,AgentPProf 在 CodeTraceBench 上对人工标注的 F1 达到 0.764 $B^3$,在三个问题定位基准上提升 MAP 最多 56%,证明其能够有效归因资源、定位问题并在实际 profiling 成本下帮助优化 token 开销。项目代码已开源于 https://github.com/eunomia-bpf/agentsight

点评

原文链接: https://arxiv.org/abs/2609.20301

[h] 返回首页