论文
LoRA-GA$^2$:具有多步梯度自适应对齐的低秩自适应
LoRA-GA$^2$: Low Rank Adaptation with Multi-step Gradient Adaptive Alignment
摘要
低秩适应 (LoRA) 是一种适用于大型模型的著名 微调 方法,可通过减少内存开销实现有竞争力的性能。然而,LoRA 和完整的 微调 之间仍然存在持续的性能差距。最近的研究试图通过采用预训练权重的一步梯度近似来缩小这一差距,以使 LoRA 更新与完整 微调 更新的主方向或内在维度保持一致。然而,这些方法无法捕获梯度的完整动态。在本文中,我们提出了 LoRA-GA$^2$,这是一种有效的 微调 算法,充分利用多步梯度信息。具体来说,我们引入了一种用于预训练权重的多步梯度的轻量级探针,它不会产生额外的 GPU 内存成本,并且只会产生边际时间开销。我们进一步采用了频谱感知、基于重要性的排名分配和从多步梯度导出的最佳初始化。大量实验结果表明,LoRA-GA$^2$ 始终优于现有 LoRA 变体,同时保留了普通 LoRA 的效率优势。例如,LoRA-GA$^2$ 在 GLUE 基准上平均超过领先基线 0.66 点,在 GSM8K 上比最强基线高出 1.03 点,在 HumanEval 上比最强基线高出 0.87 点。