论文
低秩适应的严格样本复杂性:匹配界限和等级选择
Tight Sample Complexity for Low-Rank Adaptation: Matching Bounds and Rank Selection
摘要
低秩适应 (LoRA) 已成为 微调 大型预训练模型的标准机制,但其统计特性仍然只有部分了解。现有的泛化结果提供了 O~(sqrt(rd/n)) 或 O~(rd/n) 形式的上界,但缺少匹配的下界,并且如何选择 LoRA 秩 r 的问题没有正式的答案。两个缺口都在这里被关闭。每当目标适应的等级最多为 r 时,局部 Rademacher 论证就经验风险最小化器超过等级 r LoRA 的超额风险建立了 O~(rd/n) 的上限。然后通过 R^{d x d} 的 r 级子空间的 Fano 型包装来证明 Omega(rd/n) 的匹配极小极大下界;该界限适用于输出位于 R 级 LoRA 类中的任何估计器。将两者结合起来会产生等级选择二分法。对于受约束的经验风险最小化器,最优排名等于内在排名 r*,过度排名会造成严重伤害。对于核范数然后截断类型的自适应估计器,过度排序是无害的,并且无论 r 如何,速率都会在 Theta~(r* d / n) 处饱和。综上所述,这三个结果描述了 LoRA 微调 在明确指定的局部二次体系内的统计复杂性,并将经验观察到的过度参数化惩罚确定为非正则经验风险最小化的属性,而不是 LoRA 类本身的属性。该理论的预测在综合跟踪回归基准和真实 LoRA 微调 上得到验证,跨三种(模型、任务)配置,涵盖 SST-2 和 MRPC 上的 DistilBERT 和 RoBERTa。所有配置在验证损失中都呈现出预测的 U 形,其中两种配置在大等级上显示出统计上显着的损失膨胀(配对排列 p = 0.016)。