自2020年以卷积神经网络和递归架构为中心的范式建立以来,音视频导航的基础网络在五年内未发生实质性变化,导致其在动态多模态序列表示方面的不足。本文提出了Samba(音视频导航的混合Mamba)。它采用自适应选择的Mamba状态编码器(M-SE)替代传统的GRU进行时间聚合,并构建了音频Mamba编码器(AME)以弥补卷积操作在捕获频谱图中的全局时频依赖性方面的局限性。实验表明,在面对未听过的声源和未见过的场景时,Samba展现出卓越的泛化性能。在Matterport3D数据集上,与现有的最先进模型相比,其导航成功率(SR)提高了11.3\%,而在具有更精细场景结构的Replica数据集上的性能提升更为显著。这种现代化的架构重构在较低的计算成本下解锁了更强的具身表示能力,为音视频导航领域的范式演变提供了一条高度稳健的技术路径。
博主点评: Samba的提出标志着音视频导航技术的一次重要进步,尤其是在处理动态和复杂场景方面。通过创新的编码器设计,Samba不仅提高了性能,还改善了计算效率,展示了未来多模态交互的潜力。其在未见场景中的强大泛化能力为实际应用开辟了新的可能性。