Agentic LLM 工作流在运行时才决定执行路径。下游计算可能是可预测的,甚至已经执行过,但必须等模型或用户决定分支后才能开始,这形成了所谓的 分支解析屏障。传统缓存无法消除该屏障,因为用于标识可复用结果的键只有在分支解析后才可得。
DynBranch 的核心思想是让未解析的分支在解析前即可被寻址。它为每个潜在子图分配一个 稳定坐标,使得在分支解析期间可以提前启动候选子图的计算,并在后续请求中直接复用已完成的子图结果。
为了控制资源开销,DynBranch 引入了两级控制器:
- 收益预测器 估算子图复用可能带来的延迟收益;
- 负载定价器 根据当前系统负载计算执行该子图的成本。只有当预计收益大于成本时,子图才会被调度执行。
DynBranch 部署在模型‑API 边界,无需修改代理框架或模型执行引擎。实验在四种基于 Qwen3‑32B 的代理工作负载上进行,使用 4× H200 GPU。结果显示,DynBranch 将平均延迟降低至最高 32%(相较于各工作负载的最佳已有系统),相对于不复用基线降低 46%–66%,且保持工作流输出一致。该优势在不同模型骨干(如 Qwen3‑8B)和消费级硬件(RTX 4090)上同样成立。
点评:DynBranch 通过提前为未决分支分配可复用坐标,实现了对潜在计算的投机执行,在保持结果正确性的前提下显著削减了端到端延迟,为大模型代理系统提供了一条高效的缓存‑调度新思路。