论文

LRCC:结合条件计算的低秩模型压缩

LRCC: Generalizing Low-Rank Compression with Conditional Computation

模型优化模型架构Transformer模型压缩稀疏化

摘要

低秩压缩通过用低秩分解替换线性变换来降低预训练语言模型的成本。然而,传统方法在推理期间使用固定的排名分配,无论输入Token如何,都分配相同的计算量。我们引入了低秩条件计算(LRCC),它通过为每个 Transformer 块训练一个轻量级路由器来在一小组嵌套的低秩路径中进行选择,从而将Token相关计算添加到预训练模型中。在训练过程中,低秩因子保持冻结,仅优化路由器。我们在 Llama 和 Qwen 模型上评估 LRCC,以进行语言建模和零样本下游任务。在相同的平均活动参数预算内,LRCC 比静态低秩压缩提高了预测性能,其中 Llama-2-7B 的平均下游精度比静态方法提高了 7.6 个百分点。在匹配的批量大小为 1 的解码延迟下,LRCC 提高了 Llama-3.2-1B 上的困惑度和下游准确性,并在 Llama-2-7B 上保持竞争力,无需专门的内核。最后,我们通过分析路由器的路径选择来评估分配Token明智路径的有用性。