NeFut Logo NeFut
EN 管理员登录

[AI学术] 颠覆传统:SEMA 提升注意力机制的可扩展性与效率

发布于:2026-07-19 22:00 最后更新:2026-07-22 01:02
#algorithm #Computer Vision #Attention

在变换器中,注意力机制是关键组件。然而,传统的全注意力机制在输入规模上的平方计算复杂度,以及线性注意力变体无法聚焦的问题,给计算机视觉任务带来了挑战。

我们提供了一种广义注意力的数学定义,并在此框架内对传统的 softmax 注意力和线性注意力进行了形式化。我们证明了广义注意力具有分散性,即随着键的数量趋向无穷大,查询对所有键赋予相等的权重。

受到分散性特性和最近 Mamba 注意力形式发展的启发,我们设计了可扩展且高效的 Mamba 类注意力(SEMA),该方法利用 token 定位来避免分散并保持聚焦,辅以理论上一致的算术平均来捕捉全局注意力特性。

我们在 Imagenet-1k 数据集上验证了该方法,分类结果表明 SEMA 是一种超越线性注意力的可扩展有效替代方案,在相似模型参数规模下,优于最近的视觉 Mamba 模型,尤其在处理越来越大规模的图像时表现突出。

博主点评: SEMA 的提出不仅展示了对传统注意力机制的有效改进,还为计算机视觉任务提供了更高效的解决方案。通过结合 token 定位和算术平均,SEMA 实现了在大规模数据处理中的聚焦能力,值得深入研究与应用。

原文链接: https://arxiv.org/abs/2506.08297

[h] 返回首页