我们在第二届MLC-SLM挑战赛的任务1中提交了一种级联的分离-识别系统,该系统结合了DiariZen-Large-s80 (WavLM-Large) 分割、基于CAM++嵌入的双说话者聚类,以及经过LoRA调整的omniASR LLM 7B v2识别器,在测试时无需使用oracle分割或说话者标签。
在官方开发集(150个对话,21种语言/口音类别)上,该系统达到了29.27%的宏观tcpMER,相比之下,官方基线为79.15%;在评估集上得分为50.23%。我们还分析了两项显著影响tcpMER的工程选择。首先,基于嵌入的说话者聚类优于仅从ASR转录标记分配说话者的端到端替代方案。其次,虽然重叠感知分割旨在提高分离召回率,但由于重叠语音被转录两次,反而增加了tcpMER。
博主点评: 该系统展示了在多语言环境下进行有效语音识别的潜力,尤其是在没有明确说话者标签的情况下。通过优化聚类方法和重叠处理,显著提升了识别准确率,值得在未来的研究中进一步探索这些技术的应用。