NeFut Logo NeFut
EN 管理员登录

[AI学术] MoSAR:学习自适应可近似注意力几何的语义注意力混合机制

发布于:2026-09-30 22:00 最后更新:2026-10-06 12:11
#AI #Machine Learning #Geometry

密集自注意力的二次复杂度是长上下文语言建模的主要瓶颈。多数高效方案在训练前预设稀疏或局部模式,实际上自然语言的依赖关系是随输入变化的,难以提前规定。我们将注意力近似视为几何问题,让模型从数据中学习交互几何。

提出 Mixture of Semantic Attention Regimes (MoSAR),在位置编码之后使用输入条件的 query 与 key 路由器,在短程、中程、全局三种注意力模式之间混合,形成连续的距离衰减注意力场,而非固定稀疏结构。该几何在训练中学习,可通过 top‑1 路由离散化。

实验在匹配的 5 亿参数模型上进行,MoSAR 学到的注意力覆盖范围显著更短,却不降低语言模型质量,在训练上下文长度下的困惑度优于密集 RoPE。长度外推时,MoSAR 在所有对比方法(包括 ALiBi)中取得最佳困惑度,并且在确定性 top‑1 离散化后几何保持稳定,表明其既自适应又适合低成本推理。

点评

原文链接: https://arxiv.org/abs/2609.31261

[h] 返回首页