论文

CanonQ:面向W2A4KV2的联合低位量化

Few Bits, One Law: Toward W2A4KV2

摘要

当权重、激活和 KV 缓存一起量化时,极低位 LLM 压缩最具挑战性:它们的分布不同,并且量化误差在整个网络中相互作用。我们引入了 CanonQ,这是一个统一的量化感知训练框架,它通过将源规范化与任务感知适应分开来应对这些挑战。固定旋转和能量归一化将异构张量源映射到规范坐标,从而使冻结的高斯参考码本能够跨层和模型重复使用。然后,联合训练使网络适应公共标量/向量接口内权重、激活和缓存量化的耦合误差。我们给出冻结码本迁移误差与局部任务损失的界,并导出了一个精确的归一化感知直通雅可比矩阵,将量化失真与梯度偏差联系起来。联合 W2A4KV2 压缩带来了最强的收益:在 LLaMA3-1B/3B/8B 中,与之前最先进的代表性量化基线相比,CanonQ-Omni 的 WikiText-2 困惑度最低降至基线的约1/14.28,平均零样本精度提高了 57.9%。这些优势还延伸至 Qwen3-1.7B、代码生成和数学推理:在 W2A16KV16 的指令调整 MobileLLM-Pro-1B 上,CanonQ 在 HumanEval pass@1 中实现了 41.7% 的相对改进,在 GSM8K 精确匹配中相对最强的评估量化基线实现了 39.1% 的相对改进。