论文

在线语言自适应采样可实现更好的分布式跨语言收益

Online Language Adaptive Sampling for Better Distributed Cross-lingual Gains

模型训练预训练

摘要

重新对齐是提高多语言语言模型跨语言迁移能力的一种有前途的方法,特别是对于极低资源语言(LRL)。然而,现有的重新对齐方法依赖于跨语言的并行句子的均匀和随机采样,这在有限的批量大小下可能不是最优的。在实践中,模型可能会受益于更频繁地看到某些语言,尤其是那些不一致的语言,并且最佳分布可以在整个训练过程中不断演变。在这项工作中,我们提出了一种简单而有效的自适应采样策略,为每种语言分配可训练的采样概率。对重新对齐损失贡献更大的语言在后续批次中会更频繁地采样,并且最佳分布可以在整个训练过程中不断演变。我们的方法采用了内部-外部优化循环,开销很小,从而实现了一致的性能改进,更重要的是,跨语言分配了收益。我们观察到,与统一重新调整相比,XLM-R 的所有任务平均性能提高了 0.67 美元,Gemma 2 9B 的平均性能提高了 0.60 美元。此外,我们的方法在不同模型中都是稳健的。代码可在 https://github.com/felixgaschi/multilingual-alignment-and-transfer 获取。