论文

AraYoungVoices:阿拉伯语儿童和青少年语音的多样化 L1/L2 语料库

AraYoungVoices: A Diverse L1/L2 Corpus of Arabic Child and Adolescent Speech

模型评测基准与评测资源

摘要

最先进的 ASR 系统主要针对成人母语语音,导致儿童、青少年和第二语言使用者的表现存在巨大差距。我们介绍 AraYoungVoices,这是一个 151.72 小时的阿拉伯语朗读语音语料库,由 286 名年龄在 7--18 岁的演讲者组成,其中包括 AraKids (7--12) 和 AraTeens (13--18)。 语料库包括 146 名母语为阿拉伯语 (L1) 和 140 名第二语言 (L2) 的使用者,其中母语使用者涵盖埃及、海湾、黎凡特和北非方言背景,而 L2 使用者则代表美洲、亚洲、非洲和欧洲的不同语言背景。我们使用 unseen-speaker-$\&$-unseen-prompt (USUP) 和 unseen-speaker-$\&$-seen-prompt (USSP) 评估在零样本和微调设置下对四个预训练的 ASR 模型进行基准测试。结果显示,L2 语音仍然比 L1 语音更具挑战性,观察到的最大错误主要针对年轻的 L2 说话者。特定年龄的微调改善了匹配的年龄组,而联合微调则在人群之间提供了更强的平衡。 ASR 假设也始终更接近标准阅读提示而不是逐字转录,特别是对于 L2 语音,这表明阅读偏差部分正常化。

AraYoungVoices:阿拉伯语儿童和青少年语音的多样化 L1/L2 语料库的原论文方法或结果图
图 1:AraYoungVoices 概述。平均。长度:平均提示长度(以单词为单位)。