论文
Quant.npu:通过全静态量化为设备上的 LLM 实现高效的移动 NPU 推理
Quant.npu: Enabling Efficient Mobile NPU Inference for on-device LLMs via Fully Static Quantization
摘要
大语言模型 (LLM) 越来越多地部署在移动设备上,其中神经处理单元 (NPU) 需要完全静态量化才能获得最佳推理效率。然而,现有的 后训练 量化(PTQ)方法主要依赖于动态激活量化,这使得它们与 NPU 硬件限制不兼容。为了弥合高保真 PTQ 和 NPU 约束推理之间的差距,我们提出了 Quant.npu,一种仅整数的完全静态量化框架。它结合了可学习的量化参数和旋转矩阵,无需运行时量化参数重新计算即可实现低位激活权重量化。至关重要的是,我们发现量化参数的初始化和选择性优化对于优化稳定性至关重要,因为不正确的初始化和朴素联合优化会导致梯度不稳定,从而破坏旋转矩阵的优化。为了解决这个问题,我们提出了针对不同激活配置文件定制的旋转和位宽感知初始化,以及针对旋转和未旋转张量定制的分布感知选择性优化(两级量化管道)。此外,我们引入了一种灵敏度引导的自适应混合精度方案来平衡准确性和推理效率。对现实世界的移动 NPU 进行的大量实验表明,Quant.npu 的精度可与最先进的方法相媲美,同时将推理延迟降低高达 15.1%。