论文

SAD-LoRA:低秩 知识蒸馏 的光谱对齐

SAD-LoRA: Spectral Alignment for Low-Rank Knowledge Distillation

摘要

将经过微调的教师提炼为适应 LoRA 的学生是参数高效压缩的标准方法,但输出级 KD 并没有明确控制适配器占用的rank-$r$权重子空间。我们提出 \textbf{SAD-LoRA} (\textbf{S}pectral \textbf{A}lignment \textbf{D}istillation),它从数据加权学生空间参考更新 $\DWT\Sigx^{1/2}$ 中选择这个子空间,并在训练期间通过 $\colspan(B)$ 上的可微主角损失来维护它。我们证明了数据加权 蒸馏 误差完全分解为子空间失准、子空间内系数失配和不可约秩残差;标准 KD 只能通过输出梯度间接影响第一项。在具有平坦教师谱的受控合成问题上,SAD-LoRA 将子空间错位项从 $51\%$ 减少到接近零,并将最终子空间对齐从 $0.49$ 提升到 $1.00$。在 RoBERTa-large 到 RoBERTa-base 蒸馏 的六个 GLUE 任务中,SAD-LoRA 提高了秩效率:在 $r{=}4$ 时,它在六个任务中的五个上匹配或击败了最强的包含频谱基线,在 $r{=}8$ 时,它在 SST-2 和 CoLA 上给出了最佳结果。消融将子空间对齐识别为承载分量,而系数匹配是辅助的。