论文

LoRA优化中缩放因子的隐藏力量

The Hidden Power of Scaling Factor in LoRA Optimization

模型训练参数高效训练

摘要

在低秩适应(LoRA)中,缩放因子 $α$ 通常被视为学习率的补充,但其在优化中的作用仍然知之甚少。在本文中,我们揭示了缩放因子 $α$ 和学习率的作用不同,其中 $α$ 成为有效优化的主要驱动力,提供无法仅通过学习率缩放来复制的收益。通过广泛的实证分析和理论信号漂移框架的协同作用,我们发现了 LoRA 缩放机制的三个发现:首先,LoRA 的频谱抑制使优化景观变得平滑,使标准超参数过于保守并产生优化差距。其次,当利用这种平滑性来加速收敛时,$α$ 通过放大任务信号而不增加漂移比来优于学习率。第三,最佳缩放因子遵循与秩的次线性关系,其特征在于具有意外大系数的平方根定律,揭示了现有秩相关启发式的缩放不足。基于这些见解,我们提出了 LoRA-$α$,这是一个极简框架,可将 $α$ 恢复到其原则状态,使 LoRA 与标准的小学习率兼容。对不同任务的广泛评估表明,LoRA-$α$ 持续提高性能,同时简化超参数搜索,释放 LoRA 的学习潜力。

LoRA优化中缩放因子的隐藏力量:论文配图
图 3:Flux.1-12B 上图像定制的定性比较,基本学习率为 1×10−41\times 10^{-4},等级为 8。LoRA-α\alpha 始终实现对参考对象的更高保真度。