论文
Ascend NPU 上 openPangu 量化的实证研究
An Empirical Study of openPangu Quantization on Ascend NPUs
摘要
openPangu 模型对于私人和国内大型语言模型部署来说是有吸引力的目标,但它们在 Ascend NPU 上激进的 后训练 量化下的鲁棒性尚未得到系统的表征。本文在华为Ascend 910B1 NPU上对openPangu 1B和7B模型进行了受控实证研究。我们在统一的校准和评估协议下评估代表性的仅权重和权重激活 后训练 量化方法,包括 RTN、GPTQ、AWQ、SmoothQuant、GPTAQ、BiLLM 和 SliM-LLM。在 18 个评估任务中,我们发现 8 位仅权重量化对于两种模型来说都是有效无损的,而 4 位量化对于 7B 模型仍然实用,但在推理、数学和代码任务上对 1B 模型的危害明显更大。超低精度仍然具有挑战性:大多数 2 位和二进制设置崩溃为近乎随机的行为,并且 W4A4 SmoothQuant 在我们的评估中产生非有限的困惑。这些结果为选择 openPangu 量化设置提供了面向 NPU 的精度图,并突出了极低位压缩的持续困难。