论文

LoRA的优化后自适应秩分配

Post-Optimization Adaptive Rank Allocation for LoRA

摘要

现代基础模型规模的指数级增长,使低秩适应(LoRA)作为参数高效微调技术得到广泛采用。然而,标准LoRA实现无视各模型层内在维度的差异而强制使用统一秩,导致参数冗余。我们提出优化后自适应秩分配(PARA),一种面向LoRA的无数据压缩方法,可无缝集成到现有微调流水线中。PARA利用奇异值分解,基于跨所有层的奇异值全局阈值来剪枝LoRA的秩。由此得到基于逐层谱重要性的非均匀秩分配。作为一种事后方法,PARA避免了动态架构通常所需的训练改动及其带来的不稳定。我们实证表明,PARA在多个视觉和语言基准上将参数量减少75-90%,同时保持原始未压缩LoRA的预测性能。代码将在论文被接收后发布。

LoRA的优化后自适应秩分配:论文配图
图 1:LoRA 上跨层类型和深度的排名分布,该 LoRA 在食品 101 图像分类任务中以排名 16 进行训练,并由 PARA 压缩到平均排名 4。PARA 根据谱重要性自动分配排名。