我们提出了 AV-JEPA,这是 LeJEPA 的一个优雅的多模态扩展,专注于音视频自监督学习。该模型采用早期融合的视觉变换器(Vision Transformer)和模态丢弃(modality dropout)作为掩蔽,旨在对齐全局视图和每个模态的局部视图的嵌入,同时利用 SIGReg 目标鼓励理论上最优的分布。
这一方法实现了潜在空间中的跨模态对齐,构建了一个极为简洁的架构,避免了使用解码器、EMA 教师、复杂的多项损失或对比负样本。所提出的 AV-JEPA 主干在 VGGSound 上实现了 57.1% 的 top-1 分类精度,AudioSet 上达到了 32.7 的 mAP,并支持开箱即用的 zero-shot 音视频检索。
博主点评: AV-JEPA 通过简化架构和有效的模态对齐,展示了音视频自监督学习的巨大潜力,尤其在实际应用中提供了高效的性能表现。