论文
搜索您的块浮点秤!
Search Your Block Floating Point Scales!
摘要
量化已成为一种标准技术,通过实现更快的低精度计算和减少内存传输来加速生成模型的推理。最近,GPU 加速器增加了对微尺度块浮点 (BFP) 格式的一流支持。标准 BFP 算法使用基于块的最大幅度的固定比例。我们观察到,就量化误差而言,这种尺度选择可能不是最优的。在这项工作中,我们提出了 ScaleSearch,这是选择这些比例因子的替代策略:使用细粒度搜索,利用微比例格式中的尾数位来最小化给定分布的量化误差。 ScaleSearch 可以与现有的量化方法(例如 后训练 量化和低精度注意力)集成,并被证明可以提高其性能。此外,我们还引入了 ScaleSearchAttention,这是一种基于 NVFP4 的加速注意力算法,它使用 ScaleSearch 和改编的现有技术来确保因果语言建模的性能损失接近于 0。实验表明,ScaleSearch 将 NVFP4 的量化误差降低了 27%,并将 MATH500 (Qwen3-8B) 的语言模型 PTQ 提高了多达 15 点,而 ScaleSearchAttention 将 Llama 3.1 70B 的 Wikitext-2 PPL 提高了多达 0.77 点。所提出的方法与基线性能紧密匹配,同时提供量化精度改进。