论文

入侵者阈值:LoRA 微调 的光谱定律

The Intruder Threshold: A Spectral Law for LoRA Fine-Tuning

模型评测模型行为与机制分析

摘要

LoRA 微调 可以创建入侵者维度:更新后的权重矩阵 $W+BA$ 的新前导奇异向量几乎与所有预训练的奇异向量正交,并导致灾难性遗忘。自从它们被发现以来,没有任何理论能够根据测量的光谱逐层预测它们何时出现。我们推导出每层关键更新强度 $s^\ast=\barθ/(γσ_1(BA))$,该强度是通过矩形尖峰变形变换单独从 $W$ 的测量频谱计算得出的,以及更新频谱的精确世俗方程特征,没有拟合参数。在一项涵盖四个密集 Transformer 系列、一个状态空间模型、一个专家混合模型和一个编码器-解码器(18 个适配器,9{,}840 层扫描)的预先指定研究中,该定律将经验阈值在 $82\%$ 层上的两倍以内进行局部化,在部署时将入侵者承载层与无入侵者层分开,平均 AUC 为 $0.89$,保持不变在六个第三方适配器上,并预测 WikiText-2 困惑度开始降低的位置;两个预先指定的边缘评估的组合达到 98\%$,并在外部适配器上进行开包确认 ($0.997$)。完整的微调将其更新分散到远低于每一层的阈值,这解决了LoRA和完整的微调之间的不对称性。规范匹配的干预措施证实,遗忘是由阈值跨越层而不是更新幅度带来的,而从阈值导出的尖峰预算规则,需要一个 SVD 并且不需要验证扫描,可以在最脆弱的模型上将遗忘减少 62%$,且无需任何任务成本。