Mixture-of-Experts(MoE)架构通过在每个 token 上激活固定数量的专家槽实现大语言模型的高效扩展,但固定的 top‑k 路由会导致大量冗余计算。现有的专家跳过方法多数依赖路由器置信度、校准数据或额外训练,难以准确估计被路由专家的真实贡献。\ \ ACE 提出了一套无需训练、无需校准且保持检查点完整的 token‑自适应专家跳过框架。它由两部分互补组成:\
- 全局谱代理(Global Spectral Proxy,GSP)通过耦合的 gate、up、down 投影以及 RMSNorm 缩放,估计全局变换容量;\
- 路由条件细化(Router‑Conditioned Refinement,RCR)利用中心化的路由权重构建专家特定的方向原型,并在路由偏好方向上评估专家响应。\ \ 推理时,ACE 将离线计算得到的 GSP 与 RCR 估计与实时路由门值结合,仅在两者均判定为低贡献时才跳过对应专家槽,同时始终保留贡献最大的 top‑1 专家。所有统计信息在离线完成,在线仅需表查找和轻量标量运算。\ \ 在三种 MoE 大语言模型和八个基准上的广泛实验表明,ACE 在静态和动态基线之上始终保持优势,尤其在激进的跳过比例下优势更为显著。例如,在 Qwen3.6‑35B‑A3B 上以 50% 跳过率运行时,ACE 将 WikiText‑2 的困惑度降低 7.96%,并使平均下游任务准确率提升 4.15 个百分点,超越最强竞争方法。\ \ 点评:ACE 通过离线谱分析与路由条件细化实现了高效且可靠的专家跳过,为大规模 MoE 模型的推理加速提供了实用方案。