论文
LazyTrain:大语言模型 训练中的有限资源分配以实现零废物产量优化
LazyTrain: Limited-resource Allocation toward Zero-waste Yield Optimization in Large Language Model Training
摘要
在有限的硬件上训练 大语言模型 日益成为跨 GPU 计算、主机内存、PCIe 传输和存储带宽的调度问题。现有的卸载系统减少了 GPU 驻留,MegaTrain 表明 CPU 主层流执行器可以在单个 GPU 上训练大型模型,但固定的检查点和放置启发式仍然使通信暴露在关键路径上。我们提出了 LazyTrain,这是层流执行器上的优化层。 LazyTrain 将检查点选择、激活放置、重新计算和 CPU-GPU-NVMe 通信重叠制定为混合整数调度问题,然后在训练期间执行已解决的策略。它将 8 位优化器状态与快速梯度裁剪进一步结合为单个混合 8 位运算符:状态压缩减少了优化器状态内存,而快速裁剪则抵消了额外的 CPU 端更新开销。在从 Qwen2.5-3B 到 Qwen3.6-27B 的 H800 实验中,LazyTrain 将持续 TFLOPS 比匹配的基线运行提高了约 1.24$\times$; RTX 3090 实验同样将每个模型规模的最大可行批量大小增加一。在 Qwen3.6-27B H800 MetaMathQA 的主要运行中,LazyTrain 在批量大小为 72 时达到 219.95 TFLOPS 和 1361 个词元/秒,峰值为 68.84GB GPU 内存,并在完整评估分割上获得 95.42% 的精确匹配精度。源代码可在 https://github.com/DataArcTech/LazyTrain 获取。