长时程的大语言模型(LLM)代理在运行时必须决定每次提示中包含哪些信息、顺序如何以及何时在硬性上下文窗口和字节敏感的提示缓存下压缩历史。实际系统中,这些逻辑往往分散在提示构建器、临时压缩例程、缓存失效的补救措施以及各提供商的适配层中。我们认为上下文组装在结构上等价于关系数据库的查询执行:二者都受硬预算约束、利用分层缓存并依赖统计信息。
基于此类比,ContextPipe 采用了五阶段流水线(Plan → Bind → Optimize → Execute → Feedback),并配备结构化的数据源目录、确定性的缓存感知优化器以及类似 EXPLAIN ANALYZE 的追踪机制。该设计使得上下文的组装过程可审计、可重放,并且在出现错误时能够实现隔离。
在 SWE‑bench Pro Qutebrowser 子集上的初步评估表明,与传统的追加式上下文构建策略相比,ContextPipe 将总 token 量降低了 31%,LLM 调用次数减少 23%,响应时间缩短 9%,但 KV 缓存命中率略有下降。
点评