论文

用于稳定语言模型预训练的 UE5M3 FP4 块扩展

UE5M3 FP4 Block Scaling for Stable Language Model Pretraining

摘要

稳定的 4 位浮点 (FP4) 预训练很困难,因为 E2M1 有效负载仅代表一个狭窄的幅度范围。 NVIDIA 的 Transformer 引擎 \nv{} 配方通过当前张量缩放、随机 Hadamard 变换 (RHT) 和 bfloat16 (BF16) 最终层解决了这个问题,在 FP4 矩阵乘法之外添加了工作。相反,我们将 E2M1 有效负载与无符号 E5M3 (\ue{}) 块尺度配对。它们的范围更宽,允许周期性张量缩放,而我们的方案对向后梯度应用选择性随机舍入,省略 RHT,并在所有符合条件的内部线性中使用 FP4。我们为近 1900 亿个词元预训练了 Nemotron-H 8B 模型。与 Transformer 引擎 \nv{} 相比,所提出的 block-16 配方以较低的最终窗口训练损失完成,并且在各自的量化推理策略下,以保留的负对数似然测量的验证损失较低。在所有三个报告的总量中,其量化推理下游点估计也较高。联合删除 RHT 和 BF16 最终块豁免的本机 \nv{} 执行消融将测量的模型主体词元吞吐量增加了 21.2%。这些结果证明了端到端软件模拟的 \uefp{} 预训练具有更简单的配方,并激发了对 \ue{} 块扩展的本机支持。