论文
深度寄存器改善SwiGLU的W4A4量化:读取与生成算子的分解
Depth Registers Unlock W4A4 on SwiGLU: A Reader/Generator Decomposition
摘要
我们在一个用FineWeb-Edu的50亿词元训练的3亿参数SwiGLU纯解码器语言模型上,研究训练后W4A4量化,并分析哪些输入激活位置主导误差。朴素的最近舍入W4A4使验证集困惑度从FP16下的23.6恶化至1727。训练时沿残差轴施加一种简单干预——深度寄存器结合寄存器幅值铰链损失(DR+sink)——在匹配FP16困惑度和零样本能力的条件下,将该数值降至119,约降低14倍;与SmoothQuant结合后可降至39.9。相对FP16仍有约2个困惑度单位的差距,是本研究的诊断重点。我们按输入激活位置分解W4A4误差:SwiGLU块中的五个可训练线性算子分为残差轴读取算子(qkv、w1、w3)与块内部生成算子(o_proj、w2)。基本范数分析表明,残差轴幅值控制能给读取算子较紧的界,但对w2的双线性输入只能得到两个因子上界乘积这一平凡界。实验中,DR+sink大幅降低读取算子的峰度,而生成算子基本不变;在三个匹配检查点上,读取算子改善后残留的W4A4误差约为0.28 nat,Delta-remove(w2)占主导。我们将DR+sink作为训练时诊断探针,而非部署建议:训练后的逐线性算子QuaRot方案在读取算子方向上取得近似效果。加入在线逐头value Hadamard变换和在线w2输入旋转的完整QuaRot,也未消除差距,这直接检验了正交旋转无法约束SwiGLU双线性长尾的预测。结论限于3亿参数、50亿词元和单随机种子设置;实验未将分区设计与铰链损失的作用分别隔离。