论文
WINDQuant:用于全局混合精度 LLM 量化的基于权重的神经决策
WINDQuant: Weight-Informed Neural Decision-Making for Global Mixed-Precision LLM Quantization
摘要
量化是减少 大语言模型 (LLM) 的内存占用和推理成本的有效方法,但在超低位状态下保持性能仍然具有挑战性。现有的 后训练 方法经常遭受严重的精度下降,而量化感知训练需要昂贵的再训练和额外的资源。此外,大多数混合精度策略依赖于粗粒度或启发式敏感性分析,忽略了权重矩阵内的细粒度变化。我们提出了 WINDQuant,一种基于强化学习的分配控制器,用于超低位 LLM 量化。 WINDQuant 没有引入另一个低级量化运算符,而是学习如何在全局存储预算下将位宽和量化处理分配给细粒度的列块。通过在列块级别操作,WINDQuant 可在全局目标位宽下实现层内灵活且细粒度的精度分配。该实现将 PPO 与激活感知校准、轻量级单位量化器拟合以及学习的混合精度计划的显式有效位计算相结合。 LLaMA 模型上的实验表明,WINDQuant 在超低位设置下实现了具有竞争力的性能,同时相对于基于再训练的方法减少了优化开销,凸显了强化学习作为自适应混合精度量化的实用控制器。