论文
FOCUS:通过耦合松弛与双粒度缩放优化FP4
FOCUS: FP4 Optimization via Coupled-Relaxation and Dual-Granularity Scaling
摘要
大规模语言模型(LLMs)在性能上表现出色,但由于其巨大的规模,部署成本较高。FP4量化,使用如MXFP4和NVFP4等格式,提供了一种具有硬件支持的自然解决方案。然而,维持在FP4精度下的准确性仍然困难。关键瓶颈在于规模优化:现有的方法将量化和去量化尺度紧密耦合,迫使两者都遵循硬件所需的离散低精度格式,如MXFP4中的E8M0。然而,量化尺度从未存储,无需遵守这一约束,暗示了大量未被利用的优化空间。在这项工作中,我们提出了FOCUS,一种端到端的量化框架,通过耦合松弛和双粒度缩放,用于FP4优化。耦合松弛缩放(CRS)通过可学习的全精度系数来放松量化和去量化尺度之间的紧密耦合,允许更有效的优化,而不破坏硬件合规性。双粒度缩放(DGS)进一步在更细粒度的子块中细化量化尺度,允许更精确地适应局部权重分布。在多个LLM家族和基准测试中的实验结果表明,FOCUS在MXFP4和NVFP4格式下,无论是在FP4精度下,都能达到当前的最先进的性能,同时引入了无额外推理开销。代码和量化模型将在https://github.com/tencent/AngelSlim处公开。
