论文

重新思考LLM FP4预训练中的收缩偏置:几何起源、系统性影响与UFP4配方

Rethinking Shrinkage Bias in LLM FP4 Pretraining: Geometric Origin, Systemic Impact, and UFP4 Recipe

摘要

FP4训练有望大幅削减LLM预训练的内存与计算成本——但当前FP4硬件路径与配方——包括NVIDIA Blackwell/Rubin级系统与AMD MI350系列GPU——仍以E2M1数据元素为中心。本研究识别该选择的根本局限:E2M1等非均匀格式固有 suffer 收缩偏置——由其可表示bin的几何不对称造成的系统性负舍入误差。我们表明该偏置跨层乘性累积——并被随机Hadamard变换(RHT)放大——为既有基于E2M1的FP4配方观察到的训练不稳定提供统一解释。相比之下——均匀网格(E1M2/INT4)绕开该网格几何误差——并更好地把RHT的桶利用率改进转化为更高量化质量。基于该发现——我们提出UFP4——均匀4比特训练配方——对全部三个训练GEMM施加RHT——同时把随机舍入限制在dY。在稠密1.5B、MoE 7.9B与MoE 124B长程预训练上——UFP4持续取得低于强E2M1基线的BF16相对损失退化——有缩放律分析与消融研究支撑。我们的结果提示:未来加速器应把E1M2/INT4式均匀4比特网格作为与E2M1并列的一等训练原语支持。

重新思考LLM FP4预训练中的收缩偏置:几何起源、系统性影响与UFP4配方:论文配图
(a) 单张量量化。(b) 单 GEMM 输出。图 12:张量量化和 GEMM 输出的平均 RHT 引起的 Δ​SQNR\Delta\mathrm{SQNR}。行数平均超过23层;正/负值表示 RHT 后的 SQNR 增益/损失。