NeFut Logo NeFut
EN 管理员登录

[AI学术] 注意感知路由:在混合专家模型中耦合路由与注意力

发布于:2026-09-21 22:00 最后更新:2026-09-22 02:29
#AI #Machine Learning #LLM

在混合专家(Mixture‑of‑Experts,MoE)语言模型中,路由器通常仅依据 token 的隐藏状态来选择和加权专家,这导致只能利用有限的上下文信息。我们提出 Attention‑Aware Routing(AAR),在路由器中加入从注意力权重滑动窗口中提取的时序和频谱特征,这些特征提供了模型上下文状态的摘要,且与隐藏状态解耦。\ \ 在实验中保持基础 Transformer 完全冻结,仅训练路由参数,使路由成为唯一可变因素。AAR 在 OLMoE 上的 GSM8K 基准上相较仅使用路由的 SFT 基线提升了 +3.37%。\ \ 更重要的是,我们发现路由与注意力形成了一个耦合回路:在第 $l$ 层的路由变化会通过残差流传播,在第 $l+1$ 层放大注意力汇聚(attention sinks),从而在不直接修改注意力机制的情况下重塑注意力分布。\ \ AAR 还能显著降低长文本生成的发散现象:错误答案的生成长度明显缩短,而正确答案的长度保持不变。\ \ 此外,AAR 对网络深度高度敏感:若在所有层均匀应用会削弱事实检索能力,而在更深层引入则仍能保留数学推理的提升。这揭示了检索与推理在不同深度之间的张力,层选择性的 AAR 成为探测不同层注意力所携带路由相关信息的受控手段。\ \ 点评:AAR 通过将注意力的时空特征注入路由,实现了路由与注意力的协同进化,在提升模型性能的同时提供了对内部信息流动的全新解释。

原文链接: https://arxiv.org/abs/2609.20974

[h] 返回首页