论文

用说话人分离校正转录,减少多说话人语音识别串音

Mitigating Speaker Leakage in Cascaded Multi-talker ASR with Diarization-based Transcript Correction

模型推理推理验证与自校正

摘要

虽然级联多说话者 ASR (MT-ASR) 利用最先进的基础模型,但其性能常常受到分离过程中说话人泄漏的限制。先前的纠正策略主要集中于说话者归因的词汇重新标记。我们提出了一种基于修剪的补充范例,可以稳健地识别和消除泄漏伪影。我们的方法利用预先训练的说话人说话人分离模型作为多模态验证器来修剪转录片段,以满足时间包含、词汇交叉验证和时间对齐的三方共识。 LibriMix、LibriSpeechMix 和 AMI 会议语料库的结果表明,我们的算法在不同的重叠条件下一致地降低了 cpW ER。具体来说,在具有高说话人泄漏的子集上,我们的方法实现了高达 29% 的相对 cpW ER 降低,突显了其在增强复杂声学环境中级联 MT-ASR 转录本可靠性方面的有效性。