摘要
声事件检测依赖于帧级强标签,而这些标签的标注成本高昂。主动学习通过选择最能帮助分类器的音频片段来解决这一问题。当前流行的获取策略之一是误差优先的最远遍历(MFFT),它结合了两个分类器之间的分歧与所选片段的多样性,通过硬性序列决策进行选择。该策略优先选择高分歧片段的整个组,并仅通过最远遍历分配剩余预算。
在两个多标签数据集上,我们表明这一设计对所选片段之间的相似性视而不见,并且在预算有限的情况下表现不佳,每个基于误差优先的变体都低于其所构建的简单几何策略。我们提出了误差加权设施定位(MW-FL),该方法通过一个惩罚所选片段相似性的分歧加权覆盖目标来充分利用预算。MFFT中的分歧信号用于获得该设施定位目标的非负权重,而不引入超参数。
在两个几何机制下的实验结果显示,所选片段的覆盖率是主导因素,选择的硬分歧门控对两种机制都有害,而软分歧加权在覆盖之上帮助提升了性能。MW-FL在两个数据集上都获得了最佳的学习曲线面积。
博主点评: 本文提出的MW-FL方法通过有效利用分歧信号,优化了传统的主动学习策略,展示了在预算有限的情况下如何提高音频分类的准确性。新的策略不仅关注分歧的选择,还考虑了片段间的相似性,具有重要的应用前景。