论文
超越低秩参数化:通过梯度分解缩小 LoRA 与完全微调之间的差距
Beyond Low-Rank Parameterization: Narrowing the Gap Between LoRA and Full Fine-Tuning via Gradient Decomposition
摘要
低秩适应 (LoRA) 是一种广泛使用的参数高效微调 (PEFT) 方法,但相对于完全微调 (FFT) 仍存在性能差距。许多 LoRA 变体改进了低秩因子的初始化或优化。然而,在每个训练步骤中,它们的一阶权重空间方向受到当前参数化的限制。我们描述了相应的 LoRA 可访问的梯度空间,并表明它与当前 LoRA 参数化引起的切线空间一致。该表征产生了当前模型参数下的全权重梯度的正交分解。我们将与该空间正交的分量称为法向梯度。基于这种分解,我们提出了GDLoRA(梯度分解低秩自适应)。 GDLoRA 从前向激活和后向信号重建完整的权重梯度,提取其法线分量,并直接用该分量更新基本权重,同时保留 LoRA 因子的标准 AdamW 优化。 GDLoRA 结合了互补的正态梯度,而不会在匹配的适配器和优化器配置下增加标准 LoRA 的优化器状态内存预算。自然语言理解、数学推理、常识推理和图像分类方面的实验表明,GDLoRA 始终优于 LoRA,并缩小了与 FFT 的性能差距。该代码可在 https://anonymous.4open.science/r/GDLoRA. 获取