论文

TranslatePsy-AfriSLM:低资源机器翻译的高质量数据扩展

TranslatePsy-AfriSLM: High-Quality Data Scaling For Low-Resource Machine Translation

模型训练合成数据

摘要

人工智能的快速进步在很大程度上绕过了非洲语言,造成了限制人工智能在非洲大陆采用的数字鸿沟。最近开源的 LLM 在非洲语言机器翻译方面表现系统性较差,而缺乏大规模、高质量、开源并行数据限制了有竞争力的小语言模型(SLM)的发展。我们推出 TranslatePsy-AfriSLM,它是 19 种撒哈拉以南非洲语言的开源机器翻译资源的集合,包括精选的并行数据、非洲专业合成数据和一系列经过微调的 SLM。我们的实证研究表明,统一的质量估计过滤可以在不降低质量的情况下删除高达 96% 的训练标记,并且过滤后的合成数据主导着质量效率帕累托前沿。经过对生成的数据混合进行微调,TranslatePsy-AfriSLM 的性能优于更大的系统,包括 TranslateGemma-27B 和 Qwen3.5-122B-A10B,参数少至 0.8B。