最近的字节级大语言模型(LLMs)通过将字节分组为动态大小的补丁,使得无分词器模型变得越来越具有竞争力。然而,现有的字节-补丁架构仍然将相同的密集前馈计算应用于每个补丁。这种统一的计算无法适应模型容量以适应补丁语义和粒度的变化。我们通过EntropyMoE解决了这个限制,EntropyMoE是一种为动态字节补丁设计的专家混合(MoE)架构。EntropyMoE用Top-K专家层替换了全局补丁Transformer中的密集前馈模块。每个动态补丁作为专家路由的基本单位,其字节覆盖范围决定了其对工作负载核算的贡献。路由器直接从补丁熵中选择专家,使用相同的粒度信号来组织稀疏计算,这个信号是动态补丁构造的基础。补丁熵和长度共同定义了特征空间,以调节专家专业化。实验表明,EntropyMoE在匹配的密集和稀疏基线中实现了最低的保留位/字节,同时保持了可比的下游准确性。这些结果建立了补丁熵作为稀疏条件计算的有效路由坐标,并将专家混合模型扩展到基于分词器的表示之外。 博主点评: EntropyMoE是一个创新的MoE架构,通过使用补丁熵作为路由坐标,实现了稀疏条件计算和下游准确性的平衡,这为无分词器大语言模型的发展提供了新的思路和方向。