论文

推进基于 LLM 的音素到字素的多语言语音识别

Advancing LLM-based phoneme-to-grapheme for multilingual speech recognition

应用与实践语音识别与转写

摘要

基于音素的 ASR 将识别分解为语音到音素 (S2P) 和音素到字素 (P2G),从而实现跨语言声学共享,同时将特定于语言的正字法保留在单独的模块中。虽然 大语言模型 (LLM) 对于 P2G 来说很有希望,但由于语言感知生成和严重的跨语言数据不平衡,多语言 P2G 仍然具有挑战性。我们在十种语言 CV-Lang10 基准上研究基于 LLM 的多语言 P2G。我们研究了考虑 S2P 不确定性的鲁棒性策略,包括 DANP 和简化 SKM (S-SKM)。 S-SKM是一种蒙特卡洛近似,避免了P2G训练中基于CTC的S2P概率加权。稳健的训练和低资源过采样将平均 WER 从 10.56% 降低到 7.66%。