NeFut Logo NeFut
EN 管理员登录

[AI学术] 突破性进展:SLAI T-Rex 在 Ascend SuperPOD 上实现深度学习模型的全参数后训练

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#AI #optimization #DeepSeek

在大规模分布式训练中,针对万亿参数规模的 MoE 模型进行全参数后训练带来了重大系统级挑战,包括严重的内存压力、非重叠通信开销以及低效的内核执行。尽管大多数大规模 LLM 训练系统都是基于 GPU 集群构建的,本文报告了在 Ascend NPU SuperPOD 上的端到端优化实践。

以 DeepSeek-V4 模型系列为目标工作负载,我们开发了一个层次化的优化框架,涵盖模型级并行性、计算-通信协调以及低级内核执行。最终系统实现了 34.22% 的模型 FLOPs 利用率(MFU),相比开源基线配方提升了 2.93 倍,并保持了训练的稳定性。在此优化基础上,我们进一步建立了用于复杂运筹学(OR)任务的 CPT 和 SFT 工作流。我们将集成框架称为 SLAI T-Rex。

利用 DeepSeek-V4-Flash,我们开发了面向运筹学的 CPT 和 SFT 数据管道,将收集的领域资源与求解器验证的合成优化文档结合。最终数据集包含 10,000 个高质量的 SFT 样本,涵盖四个任务类别和三种问题表示。该专业模型在评估模型中获得了最高的平均零-shot Pass@1 分数,达到了 71.81%,超越了 GPT-5.4-Mini 和基础 DeepSeek-V4-Flash 模型,分别提高了 3.98 和 11.27 个百分点。总体而言,这项工作展示了从高效的万亿参数模型后训练到领域专用 Flash 模型的全栈路径,为复杂推理的前沿模型系统的进步奠定了基础。

博主点评: 本文通过在 Ascend SuperPOD 上的优化实践,展示了如何有效解决大规模模型后训练的挑战,同时在运筹学领域取得了显著的性能提升,标志着深度学习模型在复杂任务中的应用潜力。未来,如何进一步优化计算资源的使用效率,将是一个值得关注的研究方向。

原文链接: https://arxiv.org/abs/2607.20145

[h] 返回首页