NeFut Logo NeFut
EN 管理员登录

[AI学术] 预训练ASR在嘈杂警用广播中的伪标签自适应

发布于:2026-09-28 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #LLM

预训练的自动语音识别(ASR)系统在嘈杂的广播警务通信(BPC)上表现不佳,阻碍了对警务决策过程的分析。伪标签技术提供了一条无需昂贵人工标注的无监督改进路径,但其在极端噪声环境中的有效性尚未得到验证。

本文系统评估了两种基础ASR模型——OpenAI Whisper 和 Qwen3‑ASR——在来自巴尔的摩和芝加哥的 BPC 语料上的伪标签适配潜力。实验发现,模型内部的置信度指标(对数概率和 STAR 分数)无法区分高质量与低质量的伪标签。为此我们提出了基于大语言模型(LLM)作为裁判的过滤范式,利用其参数化知识剔除上下文上不合理的转录。

LLM‑judging 过滤比内部指标更为激进,显著降低了两套 BPC 语料的伪标签训练集的词错误率(WER),但仍与理想的“oracle”过滤存在较大差距。我们进一步引入跨模型伪标签方案:让模型 A 使用模型 B 生成的伪标签进行微调,再用微调后的模型 A 为模型 B 生成新伪标签。实验表明,这种交叉微调策略在提升 ASR 性能方面具有潜力,值得后续深入研究。

点评:本文展示了 LLM 过滤在极端噪声域中的实用价值,并提出跨模型伪标签的新思路,为嘈杂环境下的 ASR 适配提供了可行路径。

原文链接: https://arxiv.org/abs/2609.30469

[h] 返回首页