论文

重新思考张量分解在 后训练 LLM 压缩中的作用

Rethinking the Role of Tensor Decompositions in Post-Training LLM Compression

模型优化模型压缩

摘要

后训练 压缩对于在资源紧张的情况下部署 大语言模型 (LLM) 至关重要。张量分解已成为一个有前途的方向,提供非常适合 Transformer 权重结构的紧凑参数化。然而,现有研究在狭窄的环境中评估这些方法,尚不清楚张量化在大规模部署中是否有效。我们系统地评估了密集和 MoE 架构的张量压缩,建立了基于实证分析和理论分析的性能权衡。我们确定了张量分解假设的共享子空间与现代 LLM 学习的异构表示之间的根本不匹配,从而描绘了它们的实际限制并阐明了它们在大规模部署中的可行作用。该代码可在 https://github.com/brain-lab-research/TT-LLM 获取。