最近的一项研究提出利用强化学习来优化大型语言模型(LLM)训练的能耗。通过在单个和多个 NVIDIA A100 GPU 上进行实验,研究人员开发了一种基于强化学习的控制器,可以根据测量的电源使用情况来调整工作负载的参数。实验结果表明,这种控制器可以减少 89.8% 的电源超限违规,同时增加 18.1% 的令牌输出和 26.2% 的能效。在 72B 模型的实验中,控制器在三次复制中实现了 35.7% 的输出增加,电源超限违规减少了 87.2%。此外,研究人员还发现,随着测量窗口的增加,电源超限违规的次数会减少。在 16 个 GPU 组成的机群中,30 秒以上的测量窗口下电源超限违规为零。 博主点评: 利用强化学习来优化 AI 数据中心的能耗是一个非常有前景的方向。这项研究表明,通过测量电源使用情况和调整工作负载的参数,可以有效地减少电源超限违规和提高能效。这种方法不仅可以降低数据中心的能耗,还可以减少碳排放,具有重要的经济和环境意义。