论文
各向同性曲率下通过联合切线空间优化的秩高效 LoRA
Rank-Efficient LoRA via Joint Tangent-Space Optimization under Isotropic Curvature
摘要
低秩适应(LoRA)是一种通过学习低秩权重更新来适应大型预训练模型的有效方法。在实践中,LoRA 等级用于控制适配器的参数预算和表示能力。我们证明这个观点是不完整的:虽然名义等级决定了表征能力,但优化器决定了在诱导的权重空间更新中使用了多少容量。在使用 LoRA 进行 GPT-2 适配的案例研究中,我们观察到强烈的排名相关优化器效应。尽管使用相同的名义等级,AdamW 通常会产生具有集中奇异谱和低有效等级的每步更新,而 Muon 使用更丰富的方向集,并且从增加 LoRA 等级中获得更一致的好处。这些观察结果激发了 ISO-LoRA,这是一种优化器,通过对权重空间中引起的切线扰动进行谱下降来耦合 LoRA 因子更新。 ISO-LoRA 促进了在单一方向上更均匀地分配能量的更新,提高了等级利用率,同时保持了与 LoRA 参数化的兼容性。我们用理论保证来补充这一设计,表明通过程式化尖峰梯度模型下的一步分析,ISO-LoRA 可以比标准因子优化器实现更高的有效排名。我们在 0.1B-7B 参数模型的语言模型适配上验证了这一设计,其中 ISO-LoRA 提高了有效排名和下游性能,在中到大型 LoRA 排名中收益最强。我们的结果强调了排名利用率是 LoRA 优化中的一个关键因素,并表明优化器设计为实现更强的参数高效适应提供了一条重要途径。