论文

逐层误差归因加速稳健的混合精度训练后量化

Layerwise Error Attribution for Fast and Robust Mixed-Precision Post-Training Quantization

模型优化模型评测应用与实践量化鲁棒性、公平性与可信度评测内容创作

摘要

混合精度训练后量化是一种网络压缩方法,它使用小型校准集在全局内存预算下逐层分配比特。主要困难是克服分配问题的组合性质以及管理对小型、可能损坏的数据库的敏感性。因此,有效的分配方法应该能够在校准数据损坏时快速计算并保持模型质量。为了设计这样的方法,我们对量化误差进行了分层概率分析,将传播误差与给定层引入的局部扰动分开。我们使用这个局部术语为简单的分配算法构建可分离的分数,不需要外部求解器。我们方法的概率性质为损坏的数据带来了稳健性。在 DRUNet 的去噪任务中,每个权重的平均预算为 4 位,我们的方法在干净校准下匹配或改进了最先进的混合精度基线,并且对损坏的校准更加鲁棒,在干净校准下 PSNR 增益高达 7.5 dB 经过测试的腐败。实验表明,位分配速度比研究的基线提高了 28 倍至 2,570 倍。对于量化扩散模型,我们的实验表明,直接应用我们的框架也可以提高最先进的水平。