论文
\k{appa}-LoRA:条件数揭示哪些 LoRA 矩阵值得更新
\k{appa}-LoRA: Condition Numbers Reveal Which LoRA Matrices Worth Updating
摘要
低秩适应(LoRA)已成为高效神经网络 微调 广泛采用的技术,将模型更新分解为低秩矩阵。然而,LoRA 的计算成本仍然很高,因为它统一更新所有矩阵,而不管它们对适应的实际贡献如何。对于具有数十亿个参数的大型模型以及边缘部署和设备上 微调 等资源受限的设置,此成本尤其令人望而却步。我们首次表明,并非所有 LoRA 矩阵都同样值得调整:条件数较小(最大奇异值与最小奇异值之比)的矩阵已经在各个方向上实现了良好平衡,并且对适应的贡献很小,而条件数较大的矩阵包含跨越更丰富子空间并驱动大部分性能增益的不发达方向。这一观察本身就是我们工作的一个关键贡献,它激发了对 微调 采取更具选择性的方法。基于这一见解,我们提出了 \k{appa}-LoRA,这是一种通过将更新集中在具有最大条件数的矩阵上来优化 LoRA 的方法,该矩阵捕获信息最丰富的变化方向。通过将 LoRA 更新限制为按条件编号排名的前 50% 权重矩阵,\k{appa}-LoRA 将可训练参数数量减半,并相应降低了计算和内存成本。跨多个基准测试的大量实验表明,该设计将 微调 时间平均缩短 16.2%,同时与标准 LoRA 的精度相匹配,并将内存成本降低 4.5%。进一步的分析表明,所选矩阵的条件数在训练过程中持续下降,这表明 \k{appa}-LoRA 的有效性源于目标光谱重新平衡,而不是单独的参数选择。