多 GPU 服务器已成为现代数据中心的标准构件,通过高速互连提供聚合容量。然而,LLM 推理等工作负载的内存需求高度动态,常导致某些 GPU 本地内存耗尽,而其他 GPU 仍有大量空闲。为了解决这种资源不匹配,EMA(Elastic Memory Allocation)提出了一种弹性内存共享模型,使同一服务器内的 GPU 可以相互借用和归还内存,形成统一的弹性容量池。
EMA 对借用方实现了性能透明:通过预取机制隐藏远程访问延迟,使得应用感知不到本地与远程内存的性能差异。对出借方则保证资源随时可回收,性能下限不低于静态划分的基准。虽然设计聚焦于内存,弹性共享的思路同样适用于带宽、计算单元等其他 GPU 资源。
实验结果显示,EMA 能将单用户吞吐提升至原来的 152%,在 2 倍容量配置下实现 96% 的理论吞吐,并保持与静态本地基线相近的延迟。
点评