论文

LoRaQ:4 位量化的优化低秩近似

LoRaQ: Optimized Low Rank Approximation for 4-bit Quantization

摘要

后训练 量化 (PTQ) 对于在资源受限的硬件上部署大扩散 Transformer 至关重要,但激进的 4 位量化会显着降低生成性能。低秩近似方法通过附加辅助线性分支来恢复性能,成为一种有前途的解决方案。然而,当前最先进的方法假设这些分支必须保持高精度(W16A16),并依赖于大量的、依赖于数据的校准来进行初始化。我们通过 LoRaQ(低秩近似量化)挑战这两个限制,这是一种简单、无数据的校准方法,可优化量化误差补偿。通过克服对高精度分支的需求,LoRaQ 实现了第一个完全低于 16 位的管道,从而允许对低秩分支本身进行量化。我们证明,在相同的内存开销下,LoRaQ 在 Pixart-$Σ$ 和 SANA 上的本机实现中优于最先进的方法。我们还分析了混合精度配置,表明低秩分支的 W8A8、W6A6 和 W4A8 等设置以及 W4 主层可以产生卓越的结果,同时保持与现代混合精度硬件兼容的完全量化架构。