论文

LoRA 需要多少等级? Transformer 注意力的排名误差界限

How Much Rank Does LoRA Need? Rank-Error Bounds for Transformer Attention

模型训练参数高效训练

摘要

选择低秩适应 (LoRA) 更新的秩通常是一项经验任务。在本文中,我们提供了一种关于 Transformer 注意力在每个 LoRA 等级上可实现的近似误差的任务相关理论。我们修复了预训练的注意力头、目标注意力函数和下游任务输入的分布,并限制了通过Rank-$r$查询LoRA更新可实现的最小预期Kullback-Leibler (KL)误差。当目标注意力概率远离零时,我们证明了与 $ψ(\|d\|_2)$ 成比例的误差下限,其中 $d$ 是候选注意力分数和目标注意力分数之间的差值,$ψ(t)=\min\{t^2,t\}$。我们还证明了无条件上限 $\min\{\|d\|_2^2/4,\sqrt2\|d\|_2\}$。然后,在显式可实现性、几何结构和矩条件下,我们将最佳秩 $r$ 误差限制在 $ψ(\sqrt{T_r})$ 和 $\min\{T_r/4,\sqrt{2T_r}\}$ 的显式倍数之间,其中 $T_r$ 是目标更新的下游加权尾部能量。当候选分数保持在目标分数的固定范围内时,我们还提供目标费舍尔界限;当标记子集承载大部分概率质量时,我们还提供不受限制的下限。这些谱界限描述了有限分数近似。然后,我们构建显式族,其中 softmax 饱和度使得匹配注意力函数所需的等级严格小于匹配有限 logits 所需的等级。最后,我们将分析扩展到融合多头 LoRA 和联合查询/密钥更新,揭示了排名共享和查询/密钥分解约束的影响。