论文
英语不是你所需要的:系统探索多语言在 LLM 后训练 中的作用
English is Not All You Need: Systematically Exploring the Role of Multilinguality in LLM Post-Training
摘要
尽管 大语言模型 得到了广泛的多语言部署,但 后训练 管道仍然主要以英语为中心,从而导致了不同语言之间的性能差异。我们基于 220 个监督 微调 在跨数学推理和 API 调用任务的并行翻译多语言数据混合物上运行,模型高达 8B 参数,对训练语言覆盖范围、模型规模和任务领域之间的相互作用进行了系统的、受控的研究。我们发现仅使用英语的 后训练 通常不是最理想的:即使合并一种非英语语言也可以提高英语性能和跨语言泛化能力。在 后训练 期间增加语言多样性通常会带来进一步的收益,特别是对于低资源语言,而高资源语言的性能往往趋于稳定而不是下降。此外,更大的语言多样性可以实现向未见过的语言的强大零样本迁移,从而减少直接包含的需要,尽管对于类型上遥远、资源匮乏的语言来说,收益仍然有限。