Mixture-of-Experts(MoE)架构在扩展性方面取得了革命性进展,但其路由逻辑仍然是个黑箱。本文揭示了一个基本的支配原则:MoE路由不仅仅是选择,更是霍夫曼编码的表现形式。我们提出了频率多样性法则,揭示了如Phi-3.5-MoE和Gemma-4-27B-A4B等最先进模型自发地作为信息理论引擎的行为。
这些模型为常见token分配稀疏的专家资源,而在链式思维路径中为稀有、复杂任务调用高多样性的专家委员会。
然而,我们发现Qwen3.5-35B-A3B中存在一个关键的冗余陷阱:当有效稀疏度(k/E_eff)足够低时,负载平衡无意中施加了功能冗余,掩盖了潜在的霍夫曼效率信号。为了解决这个问题,我们提出了子集差异修剪(Subset Difference Pruning),这是一种手术式的策略,用于消除功能重复。
我们证明修剪不会降低推理能力;相反,它释放了模型的潜在霍夫曼效率,迫使逻辑收敛到精简的高密度路径。
我们的研究结果表明,下一代MoE应超越强制负载平衡,朝着最小描述长度(MDL)最优性发展,为高频信息分配更短的专家路由代码,为低频信息分配更长且多样化的代码,从而将路由从启发式转变为原则性的压缩引擎。
博主点评: 本文通过将MoE路由与霍夫曼编码相结合,提出了一个新颖的理论框架,强调了信息理论在深度学习中的重要性。这不仅为模型优化提供了新的视角,也为未来的研究指明了方向,值得深入探索和应用。