NeFut Logo NeFut
EN 管理员登录

[AI学术] DynBranch:用于动态代理式 LLM 服务的投机子图复用

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#AI #optimization #LLM

Agentic LLM 工作流在运行时才决定执行路径。下游计算可能是可预测的,甚至已经执行过,但必须等模型或用户决定分支后才能开始,这形成了所谓的 分支解析屏障。传统缓存无法消除该屏障,因为用于标识可复用结果的键只有在分支解析后才可得。

DynBranch 的核心思想是让未解析的分支在解析前即可被寻址。它为每个潜在子图分配一个 稳定坐标,使得在分支解析期间可以提前启动候选子图的计算,并在后续请求中直接复用已完成的子图结果。

为了控制资源开销,DynBranch 引入了两级控制器:

  1. 收益预测器 估算子图复用可能带来的延迟收益;
  2. 负载定价器 根据当前系统负载计算执行该子图的成本。只有当预计收益大于成本时,子图才会被调度执行。

DynBranch 部署在模型‑API 边界,无需修改代理框架或模型执行引擎。实验在四种基于 Qwen3‑32B 的代理工作负载上进行,使用 4× H200 GPU。结果显示,DynBranch 将平均延迟降低至最高 32%(相较于各工作负载的最佳已有系统),相对于不复用基线降低 46%–66%,且保持工作流输出一致。该优势在不同模型骨干(如 Qwen3‑8B)和消费级硬件(RTX 4090)上同样成立。

点评:DynBranch 通过提前为未决分支分配可复用坐标,实现了对潜在计算的投机执行,在保持结果正确性的前提下显著削减了端到端延迟,为大模型代理系统提供了一条高效的缓存‑调度新思路。

原文链接: https://arxiv.org/abs/2609.31047

[h] 返回首页