大型语言模型(LLM)驱动的智能体服务对推理时延提出了严格要求,因而将 LLM 部署在分布式边缘服务器上成为趋势。边缘节点的网络带宽和计算能力各不相同,且每个请求的推理状态会随时间演化,这导致每个新请求的服务器选择是时变且跨时隙耦合的。本文聚焦于一个在线调度框架,目标是 最小化长期平均端到端时延 并 平衡异构边缘服务器的工作负载。
核心挑战:
- 传统的时延模型只能粗粒度描述单阶段推理,无法捕捉 LLM 多阶段(传输 → prefill → 迭代解码)以及 KV 缓存随时间的演化。
- 调度决策的时延后果只有在请求完成后才能观测,导致即时评估困难。
技术方案:
- 跨时隙推理模型:对每个请求建模四个子过程——网络传输、prefill 阶段、逐步解码以及 KV 缓存的增长。通过 KV 缓存的 内存‑时间消耗 量化服务器负载。
- LYREO 方法:
- 将长期负载均衡约束转化为 Lyapunov 优化问题,得到可在线求解的虚拟队列更新式。
- 引入 奖励重分配 与 序列化回报预测,把请求完成后才出现的时延惩罚映射为前置决策的即时学习信号。
实验结果:在多种网络/算力配置下,LYREO 相比学习型基线和启发式调度均实现了更低的平均时延(约 15%‑30%)和更均衡的 KV 缓存占用(负载方差下降约 40%),验证了跨时隙模型和 Lyapunov‑based 约束转换的有效性。
点评