论文

在端到端 LLM 中平衡 ASR 和二值化以实现多说话者语音识别

Balancing ASR and diarization in end-to-end LLMs for multi-talker speech recognition

应用与实践语音识别与转写

摘要

多说话者语音识别通常通过在管道系统中结合自动语音识别 (ASR) 和说话人分类来解决。最近,基于 LLM 的方法通过联合建模语义和说话人信息显示出前景,但它们通常需要大规模的多说话人语料库,而注释成本高昂。在本文中,我们研究了如何使用有限的真实记录数据有效地训练基于 LLM 的系统,同时保持说话者归因的高精度。我们提出了几种策略:(1)用于提取语义和说话人特征的双编码器架构,(2)将这些特征合并为 LLM 的输入的特征交织格式,(3)用于增强二值化能力的长度感知说话人 ID 损失,以及(4)用于 ASR 损失计算的自适应阈值策略,以减轻由语音重叠引起的幻觉。这些策略平衡了 ASR 和分类任务之间的训练。我们的系统优于开源基线方法,在 AliMeeting 语料库上实现了 18% 的相对改进,在 Aishell4 语料库上实现了 24% 的相对改进。