NeFut Logo NeFut
EN 管理员登录

[AI学术] 面向边缘 LLM 推理的端到端低延迟与负载均衡请求调度

发布于:2026-09-16 22:00 最后更新:2026-09-18 00:46
#AI #optimization #LLM

大型语言模型(LLM)驱动的智能体服务对推理时延提出了严格要求,因而将 LLM 部署在分布式边缘服务器上成为趋势。边缘节点的网络带宽和计算能力各不相同,且每个请求的推理状态会随时间演化,这导致每个新请求的服务器选择是时变且跨时隙耦合的。本文聚焦于一个在线调度框架,目标是 最小化长期平均端到端时延平衡异构边缘服务器的工作负载

核心挑战

  1. 传统的时延模型只能粗粒度描述单阶段推理,无法捕捉 LLM 多阶段(传输 → prefill → 迭代解码)以及 KV 缓存随时间的演化。
  2. 调度决策的时延后果只有在请求完成后才能观测,导致即时评估困难。

技术方案

实验结果:在多种网络/算力配置下,LYREO 相比学习型基线和启发式调度均实现了更低的平均时延(约 15%‑30%)和更均衡的 KV 缓存占用(负载方差下降约 40%),验证了跨时隙模型和 Lyapunov‑based 约束转换的有效性。

点评

原文链接: https://arxiv.org/abs/2609.17193

[h] 返回首页