NeFut Logo NeFut
EN 管理员登录

[AI学术] 颠覆传统的无人机声学成像:基于U-Net的密集波束能量图与音源定位

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#AI #DeepSeek #Sound Event Localization

我们提出了一种用于360°声源定位的U-Net模型,将其形式化为球面语义分割任务。该模型不再回归离散的到达方向(DoA)角度,而是将波束形成的音频图(方位角和仰角)分割为活跃声音存在的区域。

通过在定制的24麦克风阵列上使用延迟和求和(DAS)波束形成,我们生成与无人机GPS遥测对齐的信号,以创建二进制监督掩模。经过修改的U-Net在这些图的频域表示上进行训练,以识别空间分布的源区域,并通过Tversky损失处理类别不平衡。

由于该网络在波束形成的能量图上操作,因此该方法本质上是阵列无关的,可以适应不同的麦克风配置,并且可以在不同麦克风配置间进行最小适应性的迁移。分割输出通过计算激活区域的质心进行后处理,从而实现稳健的DoA估计。

我们的数据集包括对DJI Air 3无人机的真实开放场录音,这些录音与360°视频和多个日期及地点的飞行日志同步。实验结果表明,U-Net能够跨环境泛化,提供更高的角度精度,为超越传统声音源定位(SSL)的密集空间音频理解提供了一种新范式。

我们还在DCASE 2019 TAU空间声音事件基准上验证了相同的波束形成加分割的公式,表明该方法不仅适用于无人机声学,还能推广到多类声音事件定位和检测(SELD)场景。

原文链接: https://arxiv.org/abs/2508.00307

[h] 返回首页