论文

TORQ:MXFP4 量化的两级正交旋转

TORQ: Two-Level Orthogonal Rotation for MXFP4 Quantization

摘要

随着 大语言模型 (LLM) 向实际部署迈进,微尺度 FP4 (MXFP4) 格式因其平衡高动态范围与硬件效率的能力而成为下一代低位推理的基石。然而,直接将 MXFP4 应用于 LLM 激活量化不可避免地会导致精度显着下降。在本文中,我们从理论上分析了 MXFP4 激活量化的误差结构,揭示了这种性能下降的根本原因在于激活分布和 MXFP4 块浮点格式之间的两个结构不平衡:(1)极端的块间方差不平衡和(2)块内码本利用率不平衡。为了应对这些挑战,我们提出了 TORQ(MXFP4 量化的两级正交旋转),这是一个 无需训练 后训练 量化(PTQ)框架,旨在通过最佳坐标变换重塑激活空间的几何属性。在宏观层面,TORQ利用Schur-Horn定理通过块间正交旋转重新分配激活能,防止高方差块驱动共享缩放因子,从而保持小量级单元的精度。在微观层面,TORQ采用最大熵引导的块内旋转来减轻码本崩溃并最大化MXFP4码本的信息容量。在 LLaMA3 和 Qwen3 等主流 LLM 上的实验表明,与现有方法相比,TORQ 显着提高了 MXFP4 激活量化的准确性:在 Qwen3-32B 上,WikiText 上的困惑度降低至 8.43(相对于 BF16 的 7.61),平均准确度从直接 RTN 的 38.40% 提高到 73.63%(相对于 BF16)。 BF16 为 74.82%),大幅缩小了 4 位浮点量化与全精度推理之间的差距。