大语言模型(LLM)推理正从单机引擎的局部优化转向涉及可复用状态、阶段放置、异构加速器、网络、自动扩缩、可靠性以及服务水平目标的分布式控制问题。本文梳理了这一转变在学术系统研究、开源实现以及生产案例中的体现,并把 vLLM 与 llm‑d 视为互补层次。\ \ 模型服务引擎通过 PagedAttention、连续批处理、专用 kernel、量化以及并行等机制提升执行效率;而推理控制平面则负责在整个集群中决定何时、何地以及在何种策略下执行,涵盖拓扑聚合/解聚、键值存储来源与迁移、硬件变体选择、路由/接纳策略以及慢速扩缩决策。\ \ 本文的贡献在于综合已有工作而非提出新基准,所有性能和部署数据均保留原始出处。综合证据表明,现代推理的稀缺资源正从单纯的 FLOPs 转向受管控的状态、放置、网络移动、可靠性以及决策质量。\ \ 我们提出了“推理执行规划器”,它在生成可行执行计划时考虑上述多维因素,而不仅仅是终点选择。文中还提供了源码层面的基准图谱、瓶颈迁移分类、实用部署指南、基于 SLO‑goodput 的评估框架,以及面向代理化、多模态、异构和弹性推理的研究问题。\ \ 点评