NeFut Logo NeFut
EN 管理员登录

[AI学术] 突破极限:参数高效的稀疏MoE模型预取框架

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#optimization #C++ #MoE

摘要

稀疏混合专家(MoE)模型通过条件激活扩展基础模型容量,但在有限的加速器内存下,全面部署这些专家池仍然困难。尽管专家卸载通过将非活动专家转移到主机内存或存储中来缓解内存压力,但它引入了依赖路由的传输瓶颈:所需专家仅在本地的 top-K 路由后确定,这使得路由、专家加载和执行在推理过程中串行化。

为了解决这一瓶颈,我们提出了 SpecPrefetch,这是一个用于卸载 MoE 推理的参数高效预取框架。SpecPrefetch 使用共享的轻量级适配器,仅预测下层专家候选以进行异步传输,而冻结的本地路由器仍然决定最终执行的专家。通过将传输预测与执行路由分离,SpecPrefetch 减少了暴露的专家加载延迟,而不改变预训练路由的语义,因此预测错误会影响传输效率,而不是模型输出。

此外,窗口感知调度器在缓存和带宽限制下优先考虑可行的传输。在 Qwen3-VL-30B-A3B 和 DeepSeek-VL2-Tiny 的 10 个模型基准设置中,SpecPrefetch 在 9 个设置中实现了最佳的平均专家召回率,且可训练参数显著少于学习预测基线。在 Snapdragon 8 Elite 设备上,SpecPrefetch 进一步提升了解码吞吐量,最多提高了 20%,展示了在存储受限的 MoE 部署中的实际好处。代码和模型权重可在 GitHub 获取。

博主点评: SpecPrefetch 的设计通过将专家的加载与路由分离,显著提升了稀疏 MoE 模型的推理效率,尤其是在内存受限的环境中。这种创新不仅优化了模型的存取速度,还有效减少了对计算资源的需求,展现了未来 MoE 模型发展的潜力。

原文链接: https://arxiv.org/abs/2607.24787

[h] 返回首页