在多代理大语言模型工作流中,每个节点都会从记忆中检索上下文并注入到提示中,这些注入的 token 按与系统提示和用户查询相同的单价计费。现有可观测工具只能报告总 token 消耗,无法区分节点生成的 token 与接收的 token,导致费用透明度不足。本文提出“代理总成本”(Total Cost of Agency, TCA) 框架,将工作流成本分解为基础提示、推理、记忆注入、未命中惩罚和上下文累积五个部分,并给出一种两遍非计费 token 计数的精确归因方法,直接测量注入 token 而非使用词数近似。
在对 200 项企业基准任务的实测中,记忆注入占可优化的可变成本的 13.6%,占全部计费成本的约 12%。随着工作流深度从 1 增至 6,注入比例从 0 提升至 27.6%。注入 token 与深度呈线性增长 (R^2=0.9974),二次拟合的首项为负,说明在测量范围内不存在凸增长。通过将检索窗口容量从 32 条降低到 2 条,可将注入 token 减少 28.7%,而准确率变化在种子误差范围内。
实验还表明,图重写转换本身近乎成本中性,五个分解项中有两项在本实验设置下为零,总成本主要受模型层级分配支配,本文固定该层级并视为先验。未评估提示缓存,所有数据均为未缓存情形。
点评