NeFut Logo NeFut
EN 管理员登录

[AI学术] 解锁大规模音视频检索模型中的空间定位能力

发布于:2026-07-30 22:00 最后更新:2026-07-30 23:39
#AI #Machine Learning #Open Source

摘要

弱监督为音视频声源定位设定了一个实用的框架,因为大规模获取密集的空间注释成本高昂。然而,该任务依然具有挑战性,因为模型必须在没有像素级监督的情况下,从时间对齐的音视频数据中定位声源。最近训练的大规模音视频检索模型编码了丰富的多模态结构,尽管它们的潜在表示经过优化以实现全局对齐,但仍然能够启用细粒度的空间定位。虽然由于全局池化,检索骨干网络的上层逐渐丧失空间细节,但中间的视觉标记仍保留高度结构化的空间信息。

为此,我们引入了 LAIP(Localization via Audio-Informed Pooling),这是一个框架,采用轻量级的音频引导空间池化(AiSP)来替代标准的全局聚合模块。通过使用帧对齐的音频查询中间视觉标记,LAIP 恢复了被冻结检索管道丢弃的局部空间信息。我们的方案在 AVSBench 和 AVATAR 上达到了最先进的性能,后者的结果几乎翻倍。这些发现证明,准确的定位不需要从头学习,而是可以从现有的检索表示中解锁,为检索和定位任务提供了统一的路径。

博主点评:该研究展示了如何利用现有音视频检索模型的潜在表示来强化空间定位能力,极大地推动了音视频处理领域的研究进展。LAIP 框架通过智能的音频引导策略,打破了传统全局池化的限制,展现出极大的实用价值。未来,结合更多模态的信息或许能进一步提升模型的表现。

原文链接: https://arxiv.org/abs/2607.24786

[h] 返回首页