NeFut Logo NeFut
EN 管理员登录

[AI学术] Crossflow:面向代理式大模型服务的预填充-解码弹性调度

发布于:2026-09-25 22:00 最后更新:2026-09-28 00:49
#optimization #LLM #Artificial Intelligence

随着大模型服务的容量需求超过训练需求,提升服务效率变得尤为关键。预填充‑解码(Prefill‑Decode,P/D)拆分通过专门化和隔离两阶段来提高效率,但这种收益依赖于静态的资源划分。实际运行中,阶段需求并非固定。我们在大规模 LLM 集群中观察到,未缓存的输入与输出 token 比例在分钟尺度上峰值与均值的比率可达 4.7 倍;在公开的代理式工作负载中,单日内该比例的中位数跨度达 24.5 倍,而重新分配副本需要数十分钟。代理流量进一步放大了这种不匹配。若按第 95 百分位进行池容量配置,集群会有最高 17% 的资源闲置;若配置低于该阈值,则会出现排队和吞吐量未实现的情况。Crossflow 通过在不改变节点角色的前提下,使两阶段的边界具备弹性。每个解码节点会发布一个短期、可撤销的 lease,限制本地预填充计算、KV 容量、数据传输工作量以及预计输出量。跨公共和内部数据集的实验表明,Crossflow 在几何平均上提升 token 吞吐量 16.2%‑17.4%,在高负载时最高提升 43.4%,同时在所有评估点降低了平均首次响应时间(TTFT)。

点评:Crossflow 通过动态租约机制在保持节点职责不变的情况下,实现了预填充‑解码资源的自适应调度,显著提升了代理式大模型服务的效率和响应速度。

原文链接: https://arxiv.org/abs/2609.27085

[h] 返回首页