NeFut Logo NeFut
EN 管理员登录

[AI学术] 专家更少,解码更快:成本感知的混合专家推测解码

发布于:2026-07-16 22:00 最后更新:2026-07-17 08:45
#optimization #MoE #Speculative Decoding

在稀疏的混合专家(MoE)模型中,推理效率高度依赖于专家激活模式。推测解码(SD)通过并行验证多个草稿令牌来加速自回归生成,但现有的草稿选择策略主要优化接受概率。在大规模MoE模型中,选择草稿令牌还决定了在验证期间激活的专家集合。

我们观察到,基于置信度的SD可能引入了\textit{专家散射}:高概率草稿令牌可能路由到不同的专家,增加了专家权重内存流量,并降低了推测带来的加速效果。基于这一观察,我们重新审视了在MoE推理的非均匀内存成本结构下的草稿树选择。

我们提出了\textsc{EcoSpec},一种成本感知的推测解码框架,该框架在草稿选择中考虑了预测的边际专家激活成本。通过轻量级的专家预测器和动态专家缓存,\textsc{EcoSpec} 优先选择保留高接受概率的草稿路径,同时重用当前验证集已覆盖的专家,而无需修改目标模型的验证规则。

我们在三个大规模MoE模型上评估了\textsc{EcoSpec},包括DeepSeek-V3.1(671B)、Qwen3-235B-A22B和GPT-OSS-120B,在推理、编程、问答和对话基准测试中,\textsc{EcoSpec} 一直减少活跃专家的占用,并提高端到端解码速度,达到高达 $1.62 \times$ 的加速。这些结果表明,考虑专家激活成本对于大规模MoE模型中的高效推测解码至关重要。

博主点评: 该研究通过引入成本感知的推测解码,显著提升了混合专家模型的推理效率,解决了高概率草稿令牌导致的专家散射问题,展现了在大规模语言模型中优化专家激活的重要性。未来的研究可进一步探索如何在更复杂的模型中实现类似的优化。

原文链接: https://arxiv.org/abs/2607.12696

[h] 返回首页