论文
端到端约旦方言语音到文本的自监督学习框架
End-to-end Jordanian dialect speech-to-text self-supervised learning framework
摘要
如今,不同的应用程序非常需要语音转文本引擎,它是人机交互的重要推动者。尽管如此,一些语言仍然缺乏标记的语音数据,特别是阿拉伯方言或任何资源匮乏的语言。事实证明,自我监督训练过程和使用噪声训练进行自我训练的需求是即将到来的可行解决方案之一。本文提出了一种端到端的、基于 Transformer 的模型,具有适用于低资源语言的框架。此外,该框架还结合了定制的音频到文本处理算法,以实现高效的约旦阿拉伯语方言语音到文本系统。所提出的框架能够从多个来源获取数据,通过加快手动注释过程,使来自外部来源的基本事实成为可能。该框架允许使用嘈杂的学生训练和自我监督学习的训练过程在训练前和训练后阶段利用未标记的数据,并结合多种类型的数据增强。所提出的自训练方法在字错误率降低方面比微调的 Wav2Vec 模型高 5%。这项工作的成果为研究界提供了约旦语口语数据集以及处理资源匮乏语言的端到端方法。这是通过利用预训练、训练后的力量以及以最少的人为干预注入噪声标记和增强数据来完成的。它能够在阿拉伯语语音到文本领域开发新的应用程序,例如问答系统和智能控制系统,并将为智能机器人添加类人的感知和听觉传感器。