论文

MultiSynt/MT:跨 36 种语言翻译的万亿词元多并行 预训练 数据

MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages

模型训练合成数据

摘要

开放网络规模的 预训练 语料库仍然集中于英语,限制了多语言 LLM 的开发。我们推出了 MultiSynt/MT,这是一个开放的合成并行语料库,包含 36 种语言的约 4.8 万亿个目标语言标记,是通过使用 Tower+ 和 OPUS-MT/HPLT-MT 系统翻译 1000 亿个高质量 Nemotron-CC 标记而生成的。对于许多中等和较低资源的欧洲语言来说,这是最大的公开可用的 预训练 资源。在五种高资源和中等资源语言中,在 MultiSynt/MT 上训练的参考 LLM 达到了 HPLT 2.0(一种本机数据基线)的最终分数,使用的 预训练 词元减少了大约 72%,并且在匹配的 100B 词元训练预算下相对比它高出大约 15%。我们的分析还发现了评估盲点:标准多项选择基准忽略了翻译质量差异,流畅性敏感的 LLM 作为法官协议在经过训练的 LLM 上恢复,而没有检测到相对于其本地数据基线的缺陷,而挪威语惯用和文化基础的任务仍然可以通过本地数据更好地服务。我们发布了语料库,包括来自多个系统的行对齐翻译,以支持多语言 预训练 数据和评估的受控研究。