论文
简化矩阵乘法:LLM 推理的输入自适应矩阵乘积简化
Reduced Matrix Multiplication: Input-Adaptive Matrix-Product Reduction for LLM Inference
摘要
基于 Transformer 的语言模型实现了强大的性能,但由于重复的高维矩阵乘法而产生了大量的推理成本。我们提出了缩减矩阵乘法(RMM),这是一种 无需训练 输入自适应推理方法,它通过沿收缩维度选择信息切片来减少 Transformer 矩阵乘积,而无需修改模型权重。在简单的保留率控制下,RMM 提供了平滑且可预测的准确性-效率权衡。在从 1B 到 70B 参数的语言模型中,我们发现缩减容差取决于模型族、任务、组件和保留率,尽管它通常会随着模型规模的增加而提高。在适度减少的情况下,RMM 在评估的判别性、自回归生成和长上下文设置中保持稳健。我们进一步表明,同样的原理也适用于多模态视觉语言推理。机械消融揭示了 Transformer 中的结构不对称性:注意力侧计算比 MLP 组件更容易简化。最后,在 NVIDIA A100 上使用自定义内核进行的挂钟基准测试表明,这些计算节省可以转化为实际的运行时间增益,尤其是在序列长度较长的情况下。总之,这些结果将 RMM 定位为输入自适应推理时间优化的可扩展方向。