摘要
在Transformer中,$N \times N$ 的二次注意力得分矩阵是扩展到更长输入长度的主要障碍。现有的高效注意力方法通常通过引入稀疏性,使每个查询仅关注小部分键,或使用低秩/核草图,将全局交互压缩为低维表示,从而减少这一瓶颈。
我们提出了 ELSAA,一种高效的低秩与稀疏注意力近似方法。重要的是,ELSAA并不将Transformer学习到的投影或输出矩阵分解为稀疏和低秩因子。相反,在密集投影生成 $Q, K, V$ 之后,ELSAA对诱导的注意力得分算子本身进行近似:一个稀疏分支捕捉选定的高相似度交互,而一个低秩分支总结了分散的全局交互。
由于这两个分支可以在具有非常不同分母质量的支撑上进行归一化,ELSAA引入了一个考虑分母的融合项,根据稀疏分支相对于低秩分支的估计注意力质量进行缩放。这为构建低秩和稀疏的注意力输出提供了一个实用框架,旨在在保持尖锐的标记级交互和广泛的上下文混合的同时,实现更长上下文的训练。
博主点评: ELSAA方法通过引入稀疏和低秩的双重分支,有效地解决了Transformer在处理长序列时的注意力计算瓶颈。这一创新不仅提高了计算效率,还保持了模型性能,值得关注与研究。