论文
LS-LoRA:通过层敏感度选择适配位置以保留能力
Where to Adapt Matters: Layer-Selective Fine-Tuning for Capability Retention
摘要
参数高效微调 (PEFT) 使大型语言模型 (LLM) 能够适应专门的任务,但通常会降低预训练过程中获得的一般能力。现有方法主要通过数据重放或正则化,依赖于附加数据或显式优化约束来减轻这种权衡。相反,我们关注一个不同的问题:适应应该应用在哪里?我们发现,微调不同的 Transformer 层会产生不同的目标任务增益和能力退化程度,这表明并非所有层都同样适合适应。为了表征这种差异,我们使用分层经验费希尔信息来测量目标任务敏感性。然而,计算 Fisher 分数需要向后计算,并且对于大型模型来说变得越来越昂贵。因此,我们引入输入输出余弦相似度作为轻量级、仅前向的代理来排名层敏感性。在模型和任务中,输入输出相似度较低的层始终表现出较高的经验 Fisher 分数。基于这一观察,我们提出了层选择性 LoRA (LS-LoRA),它将可训练的 LoRA 适配器仅放置在输入输出相似性较低的层中。数学推理和代码生成实验表明,LS-LoRA 提高了平均目标任务性能,同时比标准全层 LoRA 保留了更多的常识推理能力,这表明仔细选择适应位置可以提供一种简单有效的方法来平衡目标任务适应和一般能力保留。