在视频理解(分类)领域,我们提出了一种分裂时空注意力模型——VideoSEMA,该模型由可扩展且高效的类似Mamba的注意力(SEMA)块和softmax时间注意力构成。在每一帧中,SEMA注意力通过局部窗口注意力与全局平均并行应用于Mamba宏架构下,这种架构被称为Mamba-like。在特定的秩条件下,我们证明了计算上更便宜的分裂时空注意力与完整的时空注意力是等效的。
在基准K400数据集上,VideoSEMA的表现优于更重的视觉变换器和Mamba模型。在基准SSv2数据集上,VideoSEMA在相似参数大小的模型中取得了最高的top-1准确率。随着图像分辨率从标准的 $224^2$ 提高到 $1024^2$ ,在K400数据集上,VideoSEMA的准确率下降远比VideoMamba更加平滑。将VideoSEMA扩展到更长视频并采用扩张/稀疏的时间注意力是非常有前景的。
博主点评: VideoSEMA通过创新的Mamba-like结构,显著提升了视频理解的效率与准确性,尤其是在高分辨率场景下的表现优于现有模型。这一进展为长视频处理提供了新的思路,值得关注。