论文

小批量持久性,八年后:批次重用的成本(以步骤和焦耳为单位)以及它节省的数据

Minibatch persistency, eight years later: what batch reuse costs in steps and joules, and what it saves in data

模型训练预训练

摘要

小批量持久性重用数据而不是读取数据:它不是在每个优化器步骤中绘制新的小批量,而是在同一个小批量上执行 K 个连续步骤。吸收到 2019 年回响的数据中,它提出了一个反对意见——重用只是模仿更大的学习率——并且没有像方法本身那样仔细调整基线。本文运行了缺失的测试。一项预先注册的研究在 FineWeb-Edu 上以 {32, 128, 512} 的小批量大小 B 训练一个 49M 参数的 Transformer,每个单元 8 个种子,分别调整每个批量大小和每个臂的学习率,反对不改变采样的免重用控制。每个标题声明都是达到固定损失的成本,从四个轴上看:优化器步骤、新鲜词元、秒数和套接字上的焦耳数。然后,我们在新种子和新一代 GPU 上进行复制,并逐步将三个分支放在一个时间表上。我们研究的结果是,小批量重用购买的既不是速度也不是能量,而是数据,而且只有在大批量大小时:在 B = 32 时,它读取的新鲜词元比基线更多,而不是更少。步数、秒数和焦耳数最多是免费的;在 B = 512 处,看起来最好,注册控制无法将重用的影响与 n = 8 个种子的学习率表上的位置分开。因此,当新鲜数据而不是计算是绑定成本时,该技术值得使用:用完的语料库、按样本付费的管道、无法倒带的流。在可以简单地再次读取数据的情况下,间隔纪元的效果也同样好甚至更好。