论文

当数据稀缺时:通过重复训练扩展稀疏语言模型

When Data Is Scarce: Scaling Sparse Language Models with Repeated Training

模型训练预训练

摘要

无限数据下密集 LLM 的缩放定律已经得到很好的探索,但稀疏性如何与有限数据相互作用却没有得到很好的探索。在这项工作中,我们研究了数据受限情况下的稀疏训练,其中有限的唯一词元需要多时期训练。我们的实验跨越了拟合集中高达 1.92B 个参数的模型,稀疏度高达 93.75%,独特数据预算高达 2.6B 个 token,在 16 个 epoch 中总训练 token 高达 41.6B;我们进一步验证了对高达 7.68B 参数的密集等效模型的外推。我们发现: 1. 数据有限设置中的稀疏扩展:我们引入了一种扩展法则,将损失建模为活动参数、唯一标记、数据重复和稀疏性的函数,从而准确预测跨计算和数据预算的性能。 2.延迟数据饱和:稀疏训练推迟了重复数据带来的收益递减,使得多epoch训练更加有效。 3. 资源权衡:对于固定数据,损失最优稀疏度适中~50%,而计算最优稀疏度更高,并随着数据规模而增长。总体而言,稀疏性不仅是提高效率的工具,而且是在数据稀缺情况下改进扩展权衡的机制。我们的代码位于:https://github.com/boqian333/sparse-dc-scaling。