论文

重新思考 LoRA 微调 的排名阈值

Rethinking the Rank Threshold for LoRA Fine-Tuning

模型训练参数高效训练

摘要

最近对神经切线内核体系中 LoRA 微调 的景观分析在 LoRA 等级 $r$ 上建立了充分条件 $r(r+1)/2 > KN$,以保证在平方误差损失下不存在虚假局部最小值,并在规范的少样本 RoBERTa 设置上规定 $r \geq 12$。该条件是针对一般输出维度 $K$ 规定的,因此它在任何特定状态下的锐度以及它对 微调 中实际使用的交叉熵损失的实际影响都是开放的。我们给出了三个结果,这些结果共同将这种情况下的二元分类的规定等级降低到 $r = 1$。首先,用非对称 LoRA 流形维度替换对称 Sard 形式计数会产生严格较弱的容量要求,在高斯独立同分布特征下 $r(m+n) - r^2 > C^* \cdot KN$ 为 $C^* \approx 1.35$,在规范设置上满足 $r = 1$。其次,在交叉熵设置中,Polyak--Łojasiewicz 不等式完全消除了等级阈值。第三,当偏差项饱和时,Rademacher 复杂度界限可以精确预测秩一方差最优性,这是二元分类的情况,但 $K > 2$ 则不然。根据经验,在四个 GLUE 式二进制任务、三个编码器架构以及 RoBERTa-large 规模上,第一级与现有处方 $r = 12$ 具有竞争力;在多类 MNLI 上,最优排名移至 1 以上,这也正如预测的那样。二进制机制保证以标准 NTK 假设为条件;多类扩展留待未来工作。