论文

参数高效微调方法真的不同吗?

Are Parameter-Efficient Fine-tuning Methods Really Different?

模型训练模型评测参数高效训练持续学习模型行为与机制分析

摘要

参数高效微调(PEFT)提供了许多参数化,但它们的方法和功能差异仍不清楚。我们比较了语言和扩散模型中的六种方法,以检查它们的参数化与任务表现、遗忘和预训练权重几何变化的关系。受正交微调(OFT)频谱保留设计的启发,我们首先询问频谱保留本身对于适应和保留是否重要。我们发现所选的 LoRA 系列方法也大致保留了预训练的几何形状,并且恢复其稍微漂移的奇异值谱在很大程度上保留了任务性能,这对显式几何保留的必要性提出了质疑。除此之外,我们观察到一些方法表现出明显的适应-保留权衡,这些权衡在不同的设置中有所不同:LoRA 在竞争表现中最一致地限制了遗忘,DoRA 在大多数比较中比 LoRA 实现了更高的平均任务分数,而 PiSSA 经常会产生更大的保留成本。进一步的干预实验表明,虽然不同 PEFT 方法的性能增益可归因于不同组光谱分量的修改,但我们一致发现,恢复主导分量而不是中间或尾随分量可以最大程度地减少一般文本 NLL 或基础图像漂移。总之,这些结果促使通过其功能后果来评估几何约束,而不是仅仅通过保存来评估。代码可在 https://github.com/Kuaaannn/PEFT_methods。 获取

参数高效微调方法真的不同吗?:论文原图
图 1:本工作中研究的问题概述。 (a) 六个代表性的 PEFT 参数化。 (b) 预训练奇异谱的变化和奇异值恢复干预。 (c) PEFT 方法的性能保留比较。 (d) 选择性保留或恢复主导成分、中间成分和尾随成分的光谱干预。奇异值衰减曲线和条形高度是示意性的。