论文

低资源僧伽罗语的自动语音识别:对方法、挑战和未来方向的批判性回顾

Automatic Speech Recognition for Low-Resource Sinhala: A Critical Review of Methods, Challenges, and Future Directions

应用与实践语音识别与转写

摘要

低资源语言的自动语音识别(ASR)仍然是一个重大挑战。僧伽罗语是斯里兰卡的主要语言,约有 1600 万使用者,它说明了其中的困难:粘着词法、54 个音素清单、主宾动词 (SOV) 语法和稀缺的注释语音数据限制了传统和现代 ASR 系统。本文首次对僧伽罗语 ASR 研究进行了批判性回顾,追溯了其从隐马尔可夫模型 (HMM) 通过深度神经网络到自监督预训练模型(如 wav2vec 2.0、XLS-R、Whisper 和大规模多语言语音 (MMS))的发展。我们将现有僧伽罗语系统与泰米尔语、马拉雅拉姆语和印地语的相关低资源 ASR 工作在架构、训练数据、字错误率 (WER) 和对现实世界声学条件的鲁棒性方面进行比较,并评估自我监督和迁移学习作为对稀缺标记数据的响应。我们表明,大多数报告的 WER 不能直接比较,因为它们在语料库、数据分割和评分方面存在差异,并且文献中唯一的对照比较将 18.1% 的相对 WER 降低归因于单独的语料库校正。我们还讨论了利用语音、句法和语义知识的上下文感知 ASR。我们发现了六个研究空白:(1)缺乏涵盖多种方言和声学条件的大型注释语料库; (2)僧伽罗语形态句法的弱语境建模; (3) 现实条件下的WER较高; (4)缺乏标准化的基准; (5)缺乏参数高效微调的研究; (6)缺乏带注释的语码转换僧伽罗语-英语语音资源。我们概述了解决这些差距的研究议程,旨在为研究僧伽罗语和其他形态丰富的语言的研究人员提供路线图。