论文

可解注意力模型中 LoRA 微调 的高维理论

High-Dimensional Theory of LoRA Fine-Tuning in a Solvable Attention Model

模型训练参数高效训练

摘要

我们在注意力模型中开发了低秩适应(LoRA)的高维统计理论,捕捉了 预训练 和 微调 之间的相互作用。我们引入了一个可解的框架,其中单头注意力层首先在数据丰富的任务上进行预训练,然后通过有限数据的秩1 LoRA 更新进行调整。在高维限制下,两个阶段都在有限的顺序参数集方面承认尖锐的渐近特征,从而对测试误差和表示对齐产生明确的预测。我们的分析表明,预训练 对 LoRA 的影响可以通过有效噪声项来概括,从中我们得出最佳 预训练 程序的规定。我们还展示了测试误差值与表示质量之间不匹配的机制,并提出将我们的理论应用于主动 微调。