论文
GaugeQuant:从 LLM 对称性在线学习量化最优基
GaugeQuant: Online Learning of Quantization-Optimal Bases from LLM Symmetries
摘要
众所周知,Transformer 具有内部连续对称性,可以在修改量化的同时使输出保持不变。 GaugeQuant 通过向破坏对称性的损失引入 LogSumExp 项来利用这种训练过程,从而选择最小化激活异常值的基础。停止梯度运算符确保仅更新旋转矩阵,从而使语言建模目标完全不变。我们不需要特定的校准数据,不需要量化模拟,并且增加的训练开销可以忽略不计。对于组大小为 128 的 W4A4 量化下的 LLaMA-2 7B 模型,困惑度从 8.22 下降到 6.73,与需要冻结模型和校准数据集的 后训练 方法竞争。在 W4A16 下,困惑度从 11.16 下降到 5.45。代码可在 https://github.com/MPedraBento/gauge-quant 获取。