NeFut Logo NeFut
EN 管理员登录

[AI学术] 颠覆性突破:cMoLLM 实现大规模混合 LLM 的水平扩展法则

发布于:2026-07-28 22:00 最后更新:2026-07-29 01:08
#AI #Machine Learning #optimization

摘要

大规模语言模型(LLMs)的扩展驱动了它们的成功,但密集的 Transformer 将容量与计算紧密耦合:每个参数在每个 token 上都被激活,导致训练和推理成本随着模型规模线性增长,这在接近万亿参数的情况下成为关键瓶颈。我们旨在通过 MoE 风格的混合在 LLM 流水线中扩展容量,而不仅仅是在前馈神经网络(FFN)中。

现有方法

之前的流水线级方法包括 ParaScale,该方法引入了虚拟 tokens 和并行流,但造成了显著的开销,并且遭受了均匀路由和梯度崩溃的问题;另一种是 AltUp,使用辅助预测分支但适应性有限且收敛缓慢。

关键创新

我们建立了 MoE 风格混合层可以被重新表述为可变核动态卷积的关系,其中每个专家对应于一个 $1\times1$ 的卷积核,路由实现输入条件的核聚合。基于这一等价关系,我们介绍了 cMoLLM:一种卷积门控的混合 LLM,通过完全可微的动态卷积在端到端流中进行路由。

性能提升

在 FineWeb 上训练的 GPT-2 风格模型中,cMoLLM 在匹配的计算条件下提高了语言建模的困惑度及下游 GLUE 和 SQuAD 准确性,具有更好的流利用率、更稳定的优化和与 ParaScale 和 AltUp 基线相比更有利的扩展性。

博主点评: cMoLLM 的提出为大规模语言模型的训练与推理开辟了新的思路,通过有效的动态卷积路由机制,显著提升了模型性能,展示了在计算资源有限的情况下,如何实现更高效的模型扩展。未来,这一方法有望在其他深度学习领域得到应用。

原文链接: https://arxiv.org/abs/2607.22577

[h] 返回首页