论文
关于随机低秩适应的收敛性
On the Convergence of Stochastic Low-Rank Adaptation
摘要
低秩适应 (LoRA) 通过两个适配器 $B \in \mathbb{R}^{m \times r}$ 和 $A \in \mathbb{R}^{r \times n}$ 优化 $J(B,A)=\mathcal L(W_\mathrm{base}+sBA)$,这两个适配器形成对冻结预训练权重矩阵 $W_\mathrm{base} \in 的低秩更新\mathbb{R}^{m \times n}$。先前的分析表明 LoRA-GD 需要 $\exp\{\mathcal{O}(ε^{-2})\}$ oracle 调用来查找 $ε$ 驻点,使得确定性设置中的 $\|\nabla J(B,A)\|\leq ε$ 成立。我们加强了分析并表明 $\mathcal{O}(ε^{-4})$ 全梯度评估足以满足相同的一阶标准。我们进一步研究无偏梯度估计和有限方差下的随机 LoRA。我们提出 LoRA-NSGDM,它找到一个具有 $\mathcal{O}(ε^{-8})$ 随机预言复杂度的 $ε$-驻点。在附加均方平滑条件下,我们使用方差减少策略并提出LoRA-STORM,将随机预言复杂度提高到$\mathcal{O}(ε^{-6})$。