大语言模型(LLM)训练是现代数据中心电力需求增长最快的来源之一,功率可用性成为 AI 基础设施扩展的主要瓶颈。让这些工作负载的功耗具备弹性有望释放额外电力、抑制电价上涨并提升电网利用率。实现弹性首先需要了解 GPU 功率下降时训练吞吐的变化。本文首次系统化地刻画作业功率弹性(即吞吐对功率下降的敏感度)。为量化弹性,我们提出功率灵活性指数(Power Flexibility Index,PFI),其定义为
$$ \text{PFI} = \frac{\frac{T{\text{reduced}}}{T{\text{full}}}}{\frac{P{\text{reduced}}}{P{\text{full}}}} $$
其中 $T$ 为每秒处理的 token 数,$P$ 为实际功率。PFI 越接近 1 表明功率下降对吞吐影响小,越低则说明弹性差。
我们在 H200 GPU 上执行了 131 次 LLM 训练(另有 24 次 H200 验证和 34 次 H100 对照),覆盖密集模型与混合专家(Mixture‑of‑Experts)模型、预训练与微调任务,规模最高 32 块 GPU。实验表明,LLM 训练作业的功率弹性显著但差异较大;通过监控 GPU 利用率、显存占用和算子占比等遥测信号,可在运行时预测 PFI。
基于预测的 PFI,我们实现了 PFI 感知的功率分配策略,在总功率受限的情况下最大化整体 token/s 吞吐。以 30% 功率削减为例,PFI‑aware 分配恢复约 1500 token/s/作业,弥补了等权分配与拥有完美信息的最优分配之间 63% 的性能缺口。
我们的工作将功率弹性定义为可测量的作业属性,为构建响应电网、功率感知的 AI 基础设施提供了量化依据。
点评