NeFut Logo NeFut
EN 管理员登录

[AI学术] ACE:自适应无校准专家跳过用于 MoE 大语言模型

发布于:2026-09-08 22:00 最后更新:2026-09-09 09:08
#AI #optimization #LLM

Mixture-of-Experts(MoE)架构通过在每个 token 上激活固定数量的专家槽实现大语言模型的高效扩展,但固定的 top‑k 路由会导致大量冗余计算。现有的专家跳过方法多数依赖路由器置信度、校准数据或额外训练,难以准确估计被路由专家的真实贡献。\ \ ACE 提出了一套无需训练、无需校准且保持检查点完整的 token‑自适应专家跳过框架。它由两部分互补组成:\

  1. 全局谱代理(Global Spectral Proxy,GSP)通过耦合的 gate、up、down 投影以及 RMSNorm 缩放,估计全局变换容量;\
  2. 路由条件细化(Router‑Conditioned Refinement,RCR)利用中心化的路由权重构建专家特定的方向原型,并在路由偏好方向上评估专家响应。\ \ 推理时,ACE 将离线计算得到的 GSP 与 RCR 估计与实时路由门值结合,仅在两者均判定为低贡献时才跳过对应专家槽,同时始终保留贡献最大的 top‑1 专家。所有统计信息在离线完成,在线仅需表查找和轻量标量运算。\ \ 在三种 MoE 大语言模型和八个基准上的广泛实验表明,ACE 在静态和动态基线之上始终保持优势,尤其在激进的跳过比例下优势更为显著。例如,在 Qwen3.6‑35B‑A3B 上以 50% 跳过率运行时,ACE 将 WikiText‑2 的困惑度降低 7.96%,并使平均下游任务准确率提升 4.15 个百分点,超越最强竞争方法。\ \ 点评:ACE 通过离线谱分析与路由条件细化实现了高效且可靠的专家跳过,为大规模 MoE 模型的推理加速提供了实用方案。
原文链接: https://arxiv.org/abs/2609.05228

[h] 返回首页