在RL基础的大规模语言模型(LLM)后训练中,通常将Rollout和Training分配至不同的GPU资源,但静态GPU分区在长尾Rollout延迟下会导致严重的流水线空洞。
为了解决这一问题,我们提出了DynaResize,一个动态GPU重新分配系统,能够在不改变强化学习(RL)语义的情况下,动态切换GPU在Rollout和Training之间,以平衡阶段执行时间。
DynaResize将重分配分解为细粒度操作,通过重用通信器、有限状态分阶段和基于滞后效应的重分配来移除非启动关键工作的执行。
实验结果显示,DynaResize可以在优化静态配置的基础上,提升端到端吞吐量66.5%,并将总体执行时间减少33%,同时隐藏27%的角色切换开销。
博主点评: DynaResize通过动态调整GPU资源分配,显著提升了大规模模型后训练的效率,展示了在资源管理上的创新潜力。这种方法不仅提升了吞吐量,还有效降低了执行时间,值得在更广泛的深度学习任务中推广应用。