论文

揭秘数据受限语言模型预训练的训练时间增强

Demystifying Training-Time Augmentation for Data-Constrained Language Model Pretraining

模型训练合成数据

摘要

随着人工智能实验室接近数据上限,计算能力超过了新的高质量文本生成的速度,语言模型预训练正在转向数据受限、计算丰富的体制,需要在固定语料库上进行高效的多时代训练。标准自回归(AR)预训练在这种情况下严重过度拟合,过早达到最佳状态,然后不断恶化。我们研究训练时数据增强作为正则化器,以减轻这种过度拟合,并能够对相同数据进行数百个时期的高效训练。我们为 AR 预训练引入了三个正交类别的增强:词元级 噪声(掩蔽、随机替换)、序列排列(从右到左预测、填充中间)和目标偏移预测($x_{t+i}$ for $i > 1$)。通过系统性消融,我们发现相对于基线,个体增强延迟了过度拟合并降低了验证损失,随机词元替换实现了个体方法中最好的最小损失。组合增强类别进一步降低了最小验证损失。我们的实验表明,数据增强可以缓解 AR 预训练的数据效率低下问题,并为数据受限的情况提供一个有前景的解决方案~\footnote{所有代码和数据均可在 https://github.com/michaelchen-lab/data-augmentations-for-pretraining 上获取。