论文
混合,不要调整:双语 预训练 在数据受限设置中优于超参数搜索
Mix, Don't Tune: Bilingual Pre-Training Outperforms Hyperparameter Search in Data-Constrained Settings
摘要
对于世界上大多数语言来说,语言模型 预训练 在数据受限的情况下运行,模型必须多次重复其训练数据,从而降低了泛化能力。存在两种补救措施:积极的超参数调整,例如高权重衰减,以及混合来自高资源辅助语言的数据以直接帮助低资源目标。超参数调整通过缩小权重来限制网络容量来规范模型,而辅助数据混合则使用可调混合比率来扩展训练分布并利用新知识使训练信号多样化。两者都提供了一种改进数据受限领域训练的原则性方法。我们在从 150M 到 1.43B 参数的四个模型尺度上系统地比较这些杠杆,使用阿拉伯语作为低资源目标,英语作为辅助,超过大约 1000 次 预训练 运行。出现了三个发现。首先,在验证损失和下游任务准确性方面,混合比超参数调整带来了更大的改进,并且差距随着模型大小的增加而增大。其次,我们量化混合的帮助程度:它在验证损失方面提高了相当于唯一目标数据 2--3$\times$ 的性能,在下游任务准确性方面提高了 2--13$\times$ 的性能,并且增益随模型大小急剧变化。第三,这种分歧表明目标语言验证损失系统性地低估了混合的价值。混合通过使训练信号多样化来进行正则化,并贡献重复目标语料库无法提供的知识;验证损失仅捕获第一个效果。我们的实际建议是:使用高资源语言进行混合,将混合比优先于超参数调整,并通过 $μ$P 从小型代理模型传输超参数。