论文

梯度和自然梯度之间:LoRA 初始化的连续体

Between Gradient and Natural Gradient: A Continuum of LoRA Initializations

模型训练参数高效训练

摘要

低秩适应 (LoRA) 以完整 微调 成本的一小部分来微调大型预训练模型,但其性能在很大程度上取决于适配器的初始化方式。最近的方案从下游损失梯度初始化适配器:一些将原始梯度投影到其顶部方向,而其他方案首先通过估计损失曲率将其白化。我们证明,这些看似不同的方法是单个连续体上的点:预条件梯度初始化的双参数族,我们将其称为统一 LoRA (ULoRA),由光谱白化指数和类 Adam 对角线指数控制。在完整的学习率搜索下扫描这个家族,我们发现没有单一的固定预处理强度占主导地位:最佳操作点是任务相关的,并且经常严格位于家族内部,远离已发布的端点。作为该系列的上限,经过调整的 ULoRA 配置在使用 RoBERTa-base 的所有五个 GLUE 任务上匹配或超过完整的 微调,并且与使用 LLaMA-2-7B 的 GSM8K 上的最强基线竞争。我们的可部署、免搜索变体 ULoRA-Auto 从测量的光谱统计数据中选择每层指数,无需额外搜索成本即可接近该上限,并且在可部署 LoRA 方法中排名处于或接近顶部。我们的结果表明,LoRA 初始化和曲率预处理的原则设计空间应被视为可调维度,而不是固定的设计决策。