论文
升腾 NPU 上语言模型 预训练 的 HiFloat4 格式
HiFloat4 Format for Language Model Pre-training on Ascend NPUs
摘要
以低数值精度训练大型基础模型是降低现代人工智能计算和内存成本最有前途的方向之一。最近的 4 位浮点格式(例如 MXFP4 和 NVFP4)可应用于 LLM 中的线性 GEMM 运算,但其有限的动态范围引入了数值不稳定性,先前的工作通过堆叠稳定机制解决了这一问题,通常以更高精度执行,并部分侵蚀了激发 FP4 的效率增益。在这项工作中,我们认为数值格式设计本身就是稳定 FP4 训练的一流杠杆,并首次在节能的华为 Ascend NPU 上系统地研究 FP4 LLM 预训练。我们将最近提出的 HiFloat4 (HiF4) 格式与 MXFP4 和 NVFP4 进行比较,在密集(OpenPangu-1B、Llama3-8B)和专家混合(Qwen3-MoE-30B)架构的所有三种格式中保持一个固定的配方,并在 FP4 中执行所有线性和专家 GEMM。在匹配的存储中——NVFP4和HiF4每个值都花费4.5位——这三种格式在训练之前所需的内容方面的差异远大于最终精度的差异。 HiF4 在没有稳定的情况下达到 1.55\% 的相对损失,低于完全稳定的 MXFP4 (1.79\%) 和低于携带每张量缩放的 NVFP4 (2.00\%); NVFP4 在我们尝试过的随机舍入和哈达玛变换的每种组合下都会发散。我们的结果表明,稳定、准确的 FP4 训练不需要不断增加的稳定技术;它需要正确的数字格式。