我们提出了一种用于360°声源定位的U-Net模型,将其形式化为球面语义分割任务。该模型不再回归离散的到达方向(DoA)角度,而是将波束形成的音频图(方位角和仰角)分割为活跃声音存在的区域。
通过在定制的24麦克风阵列上使用延迟和求和(DAS)波束形成,我们生成与无人机GPS遥测对齐的信号,以创建二进制监督掩模。经过修改的U-Net在这些图的频域表示上进行训练,以识别空间分布的源区域,并通过Tversky损失处理类别不平衡。
由于该网络在波束形成的能量图上操作,因此该方法本质上是阵列无关的,可以适应不同的麦克风配置,并且可以在不同麦克风配置间进行最小适应性的迁移。分割输出通过计算激活区域的质心进行后处理,从而实现稳健的DoA估计。
我们的数据集包括对DJI Air 3无人机的真实开放场录音,这些录音与360°视频和多个日期及地点的飞行日志同步。实验结果表明,U-Net能够跨环境泛化,提供更高的角度精度,为超越传统声音源定位(SSL)的密集空间音频理解提供了一种新范式。
我们还在DCASE 2019 TAU空间声音事件基准上验证了相同的波束形成加分割的公式,表明该方法不仅适用于无人机声学,还能推广到多类声音事件定位和检测(SELD)场景。