论文

全栈 FP4:具有量化投影、优化器和注意力的稳定 LLM 预训练

Full-Stack FP4: Stable LLM Pretraining with Quantized Projections, Optimizers, and Attention

摘要

最近的 NVFP4 预训练工作主要优化了 Transformer 线性投影,留下持久优化器状态、优化器计算和低精度注意力前向-后向路径较少探索。我们提出了 \textbf{Full-Stack FP4},一个模块化的 NVFP4 框架,具有用于投影、AdamW 状态、Root/Muon 计算和注意力的单独配方。 \textbf{LoRA-SVD} 保护 BF16 中的紧凑投影子空间,同时保留全形状 NVFP4 计算,将仅线性损失差距从 \textbf{1.40\%} 减少到 \textbf{0.61\%}。有序平方根、平铺均值和 Hadamard 管道可实现稳定的 NVFP4 AdamW 动量存储;形状相关系数和裁剪稳定直接 NVFP4 根迭代;混合精度注意力在 BF16 中保留了 softmax 敏感操作。在使用 64B 词元进行 3B 预训练时,BF16 和全栈 FP4 达到 \textbf{2.267} 和 \textbf{2.286} 的损失,即 \textbf{0.838\%} 差距。他们的平均零样本困惑度分别为 26.675 和 26.665,Full-Stack FP4 的准确度平均降低了 0.10 个百分点。一台 RTX 5090 上的本机四块测量显示,与优化的 BF16 相比,根加速提高了 2.50--2.83$\times$,AdamW 峰值内存降低了 37.9--42.5\%。