论文
平衡LoRA:消除参数不变性以加速收敛
Balanced LoRA: Removing Parameter Invariance to Accelerate Convergence
摘要
低秩适应(LoRA)是 微调 大语言模型 最广泛采用的方法。值得注意的是,LoRA 本质上是过度参数化的:多对低秩因子可以产生相同的自适应权重矩阵。我们从理论上和经验上表明,这些对表现出显着不同的条件数。因此,收敛到不同的损耗最小化器直接影响 LoRA 的收敛速度。基于这一观察,我们引入了平衡低秩适应(BaLoRA),这是 LoRA 的一种变体,它将迭代投影到平衡流形上。该流形改善了损失景观的调节,同时保留了适应的矩阵。投影步骤计算量轻,并且无缝集成到现有的 微调 管道中。根据经验,BaLoRA 的收敛速度比标准 LoRA 更快,并且在一系列 微调 任务中实现了卓越的性能。