论文

LoRA秩的作用:可达更新、容量与谱抵消成本

What Does the Rank Buy? A Spectral and Distributional Analysis of Low-Rank Adaptation

模型训练参数高效训练

摘要

LoRA 中的等级 $r$ 被广泛视为容量控制:假设较小的等级会产生更简单的模型,泛化能力更好。我们表明,在严格的每因素规范预算下——权重衰减的理想化和实践中使用的规范控制——这种直觉会崩溃。原因是结构性的:在这样的预算下,LoRA 可以达到的更新正是核范数球内最多 $r$ 的等级矩阵,并且我们分析的每个复杂性和位移函数都通过等级一更新在该集合上最大化 - 因此等级上限永远不会绑定。后果直接随之而来。我们研究的线性读出模型类对于每个 $r \ge 1$ 都是相同的,其 Rademacher 复杂度不依赖于 $r$,并且自适应可以移动源分布的距离服从我们显示的与等级无关的上限,这是尖锐的。如果等级不能控制能力,那么它在哪里发挥作用呢?我们确定两个地方。从统计上看,用产品的联合预算替换每因素预算可以恢复数据依赖、排名敏感的复杂性界限——尽管增益仅出现在分布良好的特征分布中,而且最坏的情况仍然是无排名的。从频谱上讲,排名决定了适应的代价:取消预训练权重的主导奇异方向需要足够的排名和足够的预算。我们限制了实现所需源-目标对齐的最小等级,其上限和下限在两侧光谱衰减下匹配。总之,这些结果重铸为控制哪些更新可以到达以及取消成本如何,而不是模型有多少容量。