摘要
音频语言嵌入模型如 CLAP 通常在匹配当前声音事件上进行广泛评估,但在否定语境下的表现却鲜有研究。我们的研究表明,单一的肯定性评估隐藏了一个关键限制:这些模型未能有效编码被否定的声音概念,导致肯定和否定的字幕映射到几乎相同的表示。
引入 NegEval-Audio
为揭示这一盲点,我们提出了 NegEval-Audio 框架,将现有数据集转换为两个关注否定的任务:Retrieval-Neg 和 Multiple-Choice Negation (MCQ-Neg),以探测模型是否能够区分存在与缺失的事件。
性能表现
在 AudioCaps 和 Clotho 数据集上,否定情况下的性能急剧下降,MCQ 的准确率远低于随机水平,这一失败在最新的基于多模态 LLM 的嵌入模型中仍然存在。
虽然无训练的引导方法改善了 MCQ-Neg 的表现,但对 Retrieval-Neg 的提升则微乎其微。这表明,肯定偏差是表示几何中的一个根本缺陷,亟需明确的否定意识训练目标。
博主点评: 本文深入探讨了音频语言嵌入模型在处理否定语境时的局限性,揭示了传统评估方法的盲点。通过引入 NegEval-Audio 框架,研究者为改进这一领域提供了新的视角和方法论,强调了在模型训练中纳入否定意识的重要性。