论文
LoRA 的黎曼几何与预条件更新
A Riemannian Geometry for Low-rank Adaptation
摘要
低秩自适应 (LoRA) 被广泛用作预训练深度神经网络的参数高效微调技术,该技术通过低秩矩阵 $BA^\top$ 通过完整的微调近似权重更新。此参数化导致任何可逆矩阵 $G$ 的等价关系 $(B, A) \sim (BG^{-1}, AG^\top)$,因为 $BA^\top = BG^{-1}(AG^\top)^\top$ 以及因此两个对产生相同的损失值。这种关系引出了一个商流形,其中所有 $G$ 的矩阵 $(BG^{-1}, AG^\top)$ 都被识别,消除了损失值保持不变的冗余方向。为了尊重流形的几何形状,原始搜索空间被赋予了在等价关系下不变的黎曼度量。这样的指标会在每个梯度步骤中引入预处理,并确保通过 LoRA 进行的每次权重更新都会改变损失值,从而实现高效优化。在本文中,我们提出了一种专门针对 LoRA 定制的新黎曼度量,以缩小在权重级别上与完整微调的差距。我们理论上表明,LoRA 在每次迭代时都满足以下两个属性:(i)权重更新遵循 LoRA 参数化允许的一阶权重变化子空间内最接近完整微调的梯度的方向。 (ii) 更新后的权重矩阵在 Frobenius 范数中比具有传统预处理和无预处理的 LoRA 的更新权重矩阵更接近完整的微调。这些理论见解表明,我们的预处理使 LoRA 更好地近似完整的微调,从而实现更有效的优化。实验证明了我们在语言和视觉领域的微调任务上对 LoRA 进行预处理的有效性和效率。
