论文

LoRA的第二次下降出现在失去参数量优势之后

LoRA's Second Descent Extends Beyond Parameter Parity

模型训练参数高效训练

摘要

双下降现象引发了广泛关注,近期工作将其与数据、模型和学习配置联系起来。实际微调常采用LoRA这样的低秩适配,在冻结的预训练权重上训练小型适配器。适配器的秩决定其容量,但秩与双下降的关系尚未得到充分研究。我们在标签噪声条件下,针对四种视觉骨干模型和一个7B语言模型,通过模块匹配的秩扫描(MMRS)量化这种关系。扫描延伸至超过满秩,并在相同随机种子下,将每个秩与相同模块的稠密微调配对比较。在DeiT-Tiny上,风险在秩为1时最低,随着适配器能够拟合噪声标签而急剧上升,形成插值悬崖。越过峰值后风险再次下降,但所有仍能节省参数的受测峰后秩,其风险都高于稠密微调。秩为1的LoRA在四种视觉骨干中的三种上优于稠密微调,与小秩产生强正则化的解释一致。因此LoRA表现出第二次下降,但只有失去参数优势后才能达到稠密微调的风险水平:在DeiT-Tiny上首次达到时,其投影权重数量为稠密微调的四倍。代码:https://anonymous.4open.science/r/lora-second-descent-C7B5.