论文
Transformer 加速的门控子空间推理
Gated Subspace Inference for Transformer Acceleration
摘要
提出了一种通过利用每层词元激活流形的低有效秩来加速 Transformer 语言模型推理的方法。该方法将每个激活向量分解为子空间分量和残差,通过缓存的低秩权重图像以减少的内存带宽计算子空间分量的线性层输出,并应用每个词元门来确定是计算还是跳过残差校正。该门确保输出分布保持在可控容差范围内。在 AMD MI300X 上对三个模型系列(GPT-2 124M、GPT-J 6B、OPT 6.7B)进行的验证表明,线性层权重读取的有效加速为 3.0 倍到 10.5 倍,困惑度比率低于 1.00,top-1 词元一致性高于 98%。该方法不需要重新训练,不需要架构修改,也不需要注意力机制的近似。在 GPT-J 14 6B 上的工作点(k = 256,ε = 0.05),加速模型产生与基线相同的字符输出。