在大型音频语言模型(LALMs)迅速发展的背景下,尽管其在声学理解方面取得了显著进展,但在细粒度音频推理(如事件顺序、重复和时长的识别)方面依然存在困难。
现有的后期训练方法通常依赖昂贵的外部标签,或者仅提供粗略的语义信号。为了解决这一问题,我们提出了Audio-Zero,这是LALMs领域首个无标签自进化框架,旨在提升细粒度听觉感知和推理能力。
Audio-Zero通过来自未标记音频对的听觉自我游戏构建而成:大多数参与者听到参考音频,而一名“异类”听众则听到微妙的变体。模型首先生成描述其听到内容的线索,然后通过推理线索间的不一致性来识别异类听众。由于异类听众的存在是构造所决定的,这一游戏提供了可验证的奖励,而无需任何标注答案。
通过对Qwen2-Audio-7B-Instruct和Qwen2.5-Omni-7B在TREA、MMAU Test-mini和MMAR上的实验,结果表明Audio-Zero在提升细粒度音频推理的同时,保持了广泛的音频理解。进化和诊断分析进一步揭示,通过游戏压力,越来越细粒度的听觉描述自然而然地涌现出来。
博主点评:Audio-Zero的创新之处在于其无标签的自我进化机制,打破了传统模型对标注数据的依赖,展示了在细粒度音频推理中潜在的广泛应用前景。这一方法不仅提升了模型的推理能力,也为音频处理领域带来了新的思路。其自我游戏的设计巧妙,值得深入研究和应用。