论文
NaijaS2ST:资源匮乏的尼日利亚语言语音到语音翻译的多口音基准
NaijaS2ST: A Multi-Accent Benchmark for Speech-to-Speech Translation in Low-Resource Nigerian Languages
摘要
资源匮乏语言的语音翻译仍然从根本上受到高质量、多样化并行语音数据稀缺的限制,这一挑战在非洲语言环境中尤其明显。为了解决这个问题,我们引入了 NaijaS2ST,这是一个并行语音翻译数据集,涵盖伊博语、豪萨语、约鲁巴语和尼日利亚洋泾浜语以及英语。该数据集包含每种语言大约 50 小时的语音,捕获了说话者和口音的显着变化,反映了现实的多语言和多口音条件。借助 NaijaS2ST,我们对双向翻译设置中的级联、端到端 (E2E) 和基于 AudioLLM 的方法进行了全面的基准测试。我们的结果表明,具有少量样本的音频 LLM 对于语音到文本的翻译比在微调数据上训练的级联和端到端方法更有效。然而,对于语音到语音翻译,级联和音频 LLM 范例产生了可比较的性能,这表明在为此设置开发有针对性的、特定于任务的模型方面仍有相当大的改进空间。通过提供高质量的数据集和系统基准,我们希望 NaijaS2ST 将为推进低资源、多语言语音翻译研究奠定坚实的基础。