NeFut Logo NeFut
EN 管理员登录

[AI学术] AV-JEPA:音视频自监督学习的新纪元

发布于:2026-07-20 22:00 最后更新:2026-07-22 01:02
#AI #Machine Learning #DeepSeek

我们提出了 AV-JEPA,这是 LeJEPA 的一个优雅的多模态扩展,专注于音视频自监督学习。该模型采用早期融合的视觉变换器(Vision Transformer)和模态丢弃(modality dropout)作为掩蔽,旨在对齐全局视图和每个模态的局部视图的嵌入,同时利用 SIGReg 目标鼓励理论上最优的分布。

这一方法实现了潜在空间中的跨模态对齐,构建了一个极为简洁的架构,避免了使用解码器、EMA 教师、复杂的多项损失或对比负样本。所提出的 AV-JEPA 主干在 VGGSound 上实现了 57.1% 的 top-1 分类精度,AudioSet 上达到了 32.7 的 mAP,并支持开箱即用的 zero-shot 音视频检索。

博主点评: AV-JEPA 通过简化架构和有效的模态对齐,展示了音视频自监督学习的巨大潜力,尤其在实际应用中提供了高效的性能表现。

原文链接: https://arxiv.org/abs/2607.15295

[h] 返回首页