论文
根据需要进行扩展:自适应神经元级混合精度量化感知训练
Scale When Needed: Adaptive Neuron-level Mixed Precision Quantization Aware Training
摘要
在资源有限的 6G 边缘设备上部署深度神经网络需要进行积极的压缩,同时将精度损失降至最低。量化感知训练 (QAT) 已成为一种领先的压缩方法;然而,现有的混合精度方法通常在粗层或通道级粒度上运行。这些方法通常依赖于启发式或基于搜索的位分配策略,这可能会忽略神经元级别的细粒度变异性。我们提出神经元级混合精度 QAT(NMP-QAT),其中每个神经元在训练过程中独立学习自己的离散精度。从低位精度开始,NMP-QAT 仅在训练信号需要时通过可微分代理和直通估计器扩展位宽,同时保留完全离散的推理图。这种适应性延伸到重量和激活上,减少了记忆移动。 NMP-QAT 通过 MLP 和表格基础模型架构对电信和非电信数据集进行评估,在混合精度 QAT 基线上实现了卓越的压缩精度权衡,使其非常适合网络边缘的绿色 AI 部署。