本文详细介绍了DS@GT ARC团队在BirdCLEF+ 2026中的方法,旨在从潘塔纳尔湿地的声音景观中多标签检测动物的声音。2026版新增约一个小时的标注声音景观,使得任务更倾向于适合标注集的监督管道。
首先,我们构建了一个竞争性的监督基线,结合了冻结的Perch v2骨干网、训练的HGNetV2-B0声音事件检测网络,以及非鸟类原型头,在90分钟的CPU预算内达到了私有排行榜分数0.936,排名1894。
其次,我们探讨了基于Token的表示法是否能够竞争,将来自神经音频编解码器的编解码表示与来自基础嵌入的语义表示进行对比。我们将两个生物声学专家模型与四个在AudioSet上训练的基于Token的编码器进行了比较。相关代码库可在 GitHub 找到。
博主点评: 本文展示了在鸟类声音识别任务中,传统的CNN和新兴的Token表示法之间的竞争,尤其是在数据量增大的情况下,如何利用不同的模型架构达到更高的准确率。值得关注的是Token表示法的潜力和应用前景。