MGhana-ST:加纳语言的低资源语音翻译数据集以及多语言训练权衡分析
MGhana-ST: A Low-Resource Speech Translation Dataset for Ghanaian Languages and an Analysis of Multilingual Training Trade-offs
摘要
我们提出了 MGhana-ST,这是四种资源匮乏的加纳语言变体的语音翻译数据集:Ga、Twi(Akuapem 和 Asante)、Ewe 和 Fante。 MGhana-ST 是一项正在进行的注释工作;这里的实验使用大约 16.1 小时的配对语音和英语翻译的固定子集。该音频是根据两个现有的加纳语音资源整理的。与这些资源不同的是,英文翻译是由 37 位母语注释者直接根据音频生成的,包括口头和非口头事件注释。使用 Whisper-small,我们比较了严重数据匮乏下的单语言和多语言训练,报告意味着超过三个种子。扁平的多语言训练对这种制度没有任何好处。 Ga 和 Twi 在种子方差内保持不变(相对于单语言标准差 1.63 和 2.20,+0.51 和 +0.06 BLEU),而 Ewe 下降了 6.99 BLEU,Fante 下降了 5.11。降级的变种是 Ewe,它在语言上是不同的,并且来自不同的源语料库,而 Fante 是资源最少的。将经验跨语言迁移与基于类型学的相似性进行比较,我们发现迁移 BLEU 比 URIEL 相似性更好地识别密切交互的语言对,尽管两者都不能预测哪些品种受益于联合训练。我们还报告了一项方法学发现。早期的单次分析发现四个品种中的三个呈正迁移;这无法在种子之间复制。对于 Ga 和 Twi,在 1.6 至 6.2 小时音频上训练的单语言基线的种子标准偏差大约是多语言模型的五倍和三十倍(0.35 和 0.07 BLEU)。当单语言条件较为嘈杂时,单次运行比较可以显示该大小仅从种子变异中明显转移。我们发布 MGhana-ST 以支持非洲语言语音技术和低资源语音翻译的研究。