论文

一种速率是不够的:LoRA 微调 的自适应各向异性学习速率

One Rate Is Not Enough: Adaptive Anisotropic Learning Rates for LoRA Fine-Tuning

模型训练参数高效训练

摘要

低秩自适应(LoRA)已成为大语言模型参数高效微调的标准。大多数 LoRA 变体遵循统一的 LR 约定,在每个适配器的每个一级组件上应用单一的全局学习率。我们表明,该约定忽略了模块内的实质性异质性,其中 LoRA 适配器的一级组件以高度不均匀的速率更新,而低速模块收敛到未充分利用名义等级预算的集中奇异频谱。为了解决这个问题,我们提出了一种自适应各向异性学习率模型,该模型为每个一级组件分配其自己的有效学习率,该学习率是根据训练时间信号在线计算的,并对每个模块进行均值归一化,以保留全局 LR 预算。 AnLR-LoRA 使用 AdamW 优化期间可用的两个信号(即函数空间速度和 Adam SNR)实例化该模型,作为一种轻量级方案,无需额外的可训练参数。在常识推理、自然语言生成和视觉指令调整基准方面,AnLR-LoRA 始终优于 LoRA,同时鼓励更广泛地使用排名能力,其收益在广泛的全局学习率中保持强劲,并干净地转移到其他 LoRA 变体。