NeFut Logo NeFut
EN 管理员登录

[AI学术] 校准后路由:对分离式 LLM 服务的学习请求路由的测量研究

发布于:2026-09-16 22:00 最后更新:2026-09-18 00:46
#Machine Learning #optimization #LLM

在分离式 LLM 服务中,预填充阶段计算密集,解码阶段内存密集,分别放在不同的 GPU 池。DistServe、Splitwise、Mooncake 等系统实现了快速分离,但仍需路由决定每个请求由哪个实例处理。

本文研究了一种路由器,它通过精确的提示长度、预测的输出长度、入队后的 KV 缓存压力以及 SLO 类别,估算每个实例的额外完成时间。我们在离散事件模拟器中实现该策略,并在八块 NVIDIA A40 GPU(每块运行 vLLM 引擎)上进行验证,使用 NIXL 在池间转移 KV 缓存,所有工作负载均在测得的饱和状态下运行。

在三组混合、突发的到达序列上,校准后的路由器实现了最高的平均 goodput 为 0.864,优于轮询、最少负载和长度启发式的 0.835‑0.847,并且在所有序列上方差最小。它在三条序列中均胜过轮询和长度启发式,且在两条上胜过最少负载,第三条仅落后 0.003,属于运行噪声范围。硬件校准至关重要:使用模拟器得到的常数可提升 4.5 个 goodput 点,约占尾延迟优势的 40%,否则评分器几乎等同于仅计数队列。

随着解码池规模和流量异质性的增加,收益进一步放大,但在仅有三实例的池中,队列计数已足够。极端资源紧缺时,贪婪的成本最小化会把请求集中到成本最低的实例,而盲目分散反而更好。使用校准后的成本,学习型路由器在使用六块 GPU 时即可达到轮询使用七块时的 goodput。

点评:该工作展示了通过细粒度硬件校准提升路由决策的可行性,为分离式 LLM 服务的资源利用提供了实用思路。

原文链接: https://arxiv.org/abs/2609.16206

[h] 返回首页