论文

面向嘈杂警务语音的预训练 ASR 伪标签筛选

Pretrained ASR Pseudo-labeling for Noisy Police Audio

模型训练合成数据

摘要

预训练的 ASR 系统在嘈杂的广播警察通信 (BPC) 中表现不佳,阻碍了理解警察决策的努力。伪标签提供了一种无监督的途径来改进 ASR,无需昂贵的人工标签,但这种方法在非常嘈杂的领域中的功效尚不清楚。在这项工作中,我们系统地评估了伪标签的机会和限制,以适应基础 ASR 模型(Whisper 和 Qwen3-ASR),以适应来自巴尔的摩和芝加哥的嘈杂 BPC 领域语料库。我们证明现有的内部置信度指标(对数概率和 STAR 分数)无法区分高质量和低质量的 BPC 伪标签,并且我们引入了一种外部 LLM 作为法官的过滤范例,利用参数知识来丢弃上下文中不可信的转录本。我们的 LLM 判断过滤器比内部指标更积极,并且显着降低了巴尔的摩和芝加哥 BPC 语料库中伪标记训练集的 WER,尽管相对于预言机过滤器仍然存在很大差距。我们还引入了一种新的跨模型伪标签范例,其中一个模型使用另一个模型的伪标签进行微调,我们认为这种方法是未来伪标签工作的一个有希望的方向。