论文

LoRA 与完整的 微调:理论视角

LoRA vs. Full Fine-Tuning: A Theoretical Perspective

模型训练参数高效训练

摘要

微调 使用少量标记数据将预训练模型适应下游任务。低秩适应 (LoRA) 是一种高效的 微调 方法,可减少内存和计算成本,同时通常实现接近完整 微调 的性能。尽管 LoRA 被广泛使用,但其理论行为尚未得到很好的理解。在本文中,我们在简单线性回归设置中研究 LoRA,并将其超额风险与完整的 微调 进行比较。我们的分析确定了 LoRA 在超定和欠定环境中实现比完整 微调 更低的超额风险的制度。具体来说,我们的理论预测,当预训练和下游任务之间的差异实际上是低秩时,LoRA 可以优于完整的 微调。我们进一步展示了 LoRA 等级的选择如何影响泛化性能,解释了为什么使用非常小的等级可以提高某些设置中的测试准确性,尽管它限制了模型的表达能力。最后,我们通过实际任务的实验来支持我们的理论结果,表明所确定的权衡和见解超出了线性回归的范围。