论文

SDS-LoRA:消除低秩适配中的各向异性梯度缩放

SDS-LoRA: Overcoming Anisotropic Gradient Scaling in Low-Rank Adaptation

模型训练参数高效训练

摘要

低秩适配LoRA通过低秩矩阵参数化权重更新,使大型预训练模型能高效适配下游任务。本文从几何角度分析其限制:全量微调梯度反传到低秩矩阵时,会受到奇异值驱动的各向异性缩放,偏向主奇异方向并压制其他方向。这会降低梯度的有效秩,而且无法对任意梯度实现全量梯度与低秩近似的最佳对齐,从而扩大与全量微调的差距。SDS-LoRA通过新的低秩参数化,在结构上将奇异值与反向传播解耦,使全量梯度只通过低秩子空间的正交基传播,不受尺度影响。收敛分析表明,LoRA收敛率会随低秩矩阵条件数恶化,而SDS-LoRA不依赖该条件数。在自然语言与视觉基准上的实验显示,SDS-LoRA改善损失收敛,缩小与全量微调的差距,并提高适配表现。