摘要
Mixture-of-Experts (MoE) 大语言模型在推理时仅激活少量专家,但令牌路由引入了持续的专家热度偏差:少数热门专家持续接收大部分令牌,而其他专家则负载较轻。在3.5D多芯片系统中,这种偏差不仅导致计算不平衡,还加剧了通信、内存带宽、I/O和执行队列的压力。因此,核心问题不仅仅是减少令牌移动,而是动态放置和重用热门专家副本。
本论文提出了HCRMap,一个用于在3.5D MoE推理中进行压力感知的专家副本管理的热门专家驻留映射框架。HCRMap根据专家热度、权重加载成本、迁移开销和运行时资源压力,动态确定哪些专家应该被提升、保留、降级或驱逐。然后,它将路由的令牌组映射到合适的驻留副本,从而共同减轻通信、内存和队列瓶颈。
实验结果表明,HCRMap在预填充和解码阶段分别比Hydra减少了43.6%和43.0%的端到端延迟;比MoEntwine减少了34.5%和33.1%;比PIMoE减少了46.7%和46.0%。
博主点评: HCRMap 提供了一种创新的方法来解决 MoE 模型中的热门专家负载不均问题,通过动态管理专家副本,有效减轻了系统的压力,显著提升了推理效率。此研究不仅对 LLM 的性能优化具有重要意义,也为多芯片架构中的资源管理提供了新的思路。