论文

AdaPreLoRA:Adafactor 预条件低秩适应

AdaPreLoRA: Adafactor Preconditioned Low-Rank Adaptation

模型训练参数高效训练

摘要

低秩适应 (LoRA) 将权重更新重新参数化为两个低秩因子的乘积,但将因子映射到权重矩阵的生成器的雅可比行列式 $J_{G}$ 是秩亏的,因此由任何 ${W}$ 空间预处理器 ${F}_t$ 引发的因子空间预处理器 $J_{G}^* {F}_t J_{G}$ 是奇异的,因此标准链式法则无法唯一逆逆将预先调节的 ${W}$ 空间方向映射回因子空间更新。我们将现有的 LoRA 优化器投射到一个由两个选择参数化的统一框架中:(i) 使用 $J_{G}^* {F}_t J_{G}$ 的可逆代理,以及 (ii) 在 ${W}$ 上使用哪个 ${F}_t$。现有方法沿着这些轴占据四个系列:因子空间自适应更新、$J_{G}^* J_{G}$ 的块对角代理、Frobenius 残差伪逆方法和黎曼流形约束。在此设计空间中,梯度统计感知 ${F}_t$ 与 ${O}((m+n)r)$ 内存处的封闭式因子空间求解配对仍然未被充分探索。我们提出 \textbf{AdaPreLoRA},它通过在 ${W}$ 上采用 Adafactor 对角克罗内克预处理器 ${H}_t$ 并从生成的因子空间解决方案族中选择最小化两个因子贡献之间的 ${H}_t$ 加权不平衡的元素来填补这一空白;通过构造,得到的因子更新是在 ${H}_t$ 加权范数下最接近预处理 ${W}$ 空间方向的 LoRA 近似。在 GPT-2 (E2E)、Mistral-7B 和 Qwen2-7B(GLUE、ARC、GSM8K)和扩散模型个性化方面,AdaPreLoRA 可以与一组代表性的 LoRA 优化器竞争或有所改进,同时将峰值 GPU 内存保持在 LoRA 优化器级别。