在音乐结构分析(MSA)领域,目标是揭示音乐作品的高级组织结构。尽管现有的最先进方法通常依赖于监督深度学习,但这些方法受到大量标注数据需求和固有结构模糊性的制约。本文提出了一种无监督评估九种开源通用预训练深度音频模型在 MSA 上的表现。
对于每个模型,我们提取了按小节划分的嵌入,并使用三种无监督分割算法进行分段:Foote 的棋盘核、谱聚类和相关块匹配(CBM),重点关注边界检索。我们的结果表明,现代通用深度嵌入的表现通常优于传统的基于谱图的基线,但并非系统性地。此外,我们的无监督边界估计方法的表现普遍优于近期的线性探测基线。在评估的技术中,CBM 算法始终是最有效的下游分割方法。
最后,我们指出标准评估指标的人工膨胀,并倡导系统性采用“修剪”或甚至“双重修剪”注释,以建立更严格的 MSA 评估标准。
博主点评: 本文通过无监督的方法探索音乐结构分析,突破了对标注数据的依赖,展现了深度学习在音频处理领域的潜力。特别是 CBM 算法的有效性为未来的研究提供了新的方向,值得关注。