论文
归一化低秩适应
Normalized Low-Rank Adaptation
摘要
虽然低秩自适应(LoRA)广泛用于参数高效的模型自适应,但如何规范其训练动态以实现稳定有效的优化仍有待探索。由于 LoRA 将上投影初始化为零,因此其早期优化动态很大程度上受下投影控制。基于这一观察,我们引入了归一化低秩适应(NoRA),这是一种简单而有效的方法,可以在训练期间对下投影矩阵进行归一化。我们进一步表明,相同的归一化只能在初始化时应用,从而改进标准 LoRA,而无需在整个训练过程中重复归一化。在预训练、监督微调和强化学习中,NoRA 持续加速收敛,提高性能和训练稳定性,并减少灾难性遗忘。这些好处既不需要额外的可训练参数,也不需要推理时间计算,使得 NoRA 成为 LoRA 的简单且广泛适用的增强功能。