论文
可训练的平滑旋转变换,具有用于 LLM 量化的学习通道尺度
Trainable Smooth-Rotation Transforms with Learned Channel Scales for LLM Quantization
摘要
后训练量化(PTQ)是降低大语言模型(LLM)服务成本的最实用方法之一,但激活量化仍然很困难,因为异常值主导的通道会导致较大的量化误差。本文研究了这种退化的部分原因是否是由于基于缩放的等效变换中的过度迁移引起的。我们通过用高分位数替换基于最大值的激活统计数据,为 SmoothRot 式变换引入了分位数鲁棒缩放策略,并用基于约束梯度的通道尺度优化对其进行了补充。在 W4A4 量化下的 LLaMA-3.2-1B 上,仅分位数策略搜索将选择层误差比 SmoothRot 基线提高了 11.1%,联合 (alpha, q) 搜索将其提高了 12%,训练达到 18.5%。在所有解码器块下投影层上重放最佳选择层策略将相应的全层平均误差从 97.51 降低到 78.08 (19.9%)。结果表明,稳健的迁移控制和轻量级学习比基于最大值的固定策略提供了一致的增益,同时保留了等效变换框架。