论文

重思适配器放置:主导适配模块视角

Rethinking Adapter Placement: A Dominant Adaptation Module Perspective

模型训练参数高效训练

摘要

低秩适应(LoRA)是一种广泛使用的参数高效微调方法,它将可训练的低秩适配器放入冻结的预训练模型中。最近的研究表明,使用较少的 LoRA 适配器仍然可以保持甚至提高性能,但现有方法仍然广泛分布适配器,从而使在哪里放置有限数量的适配器以最大限度地提高性能在很大程度上是开放的。为了研究这个问题,我们引入了 PAGE(预计适配器梯度能量),这是一种基于梯度的灵敏度探针,可估计每个候选 LoRA 适配器可用的初始可训练梯度能量。令人惊讶的是,我们发现 PAGE 高度集中于跨两个模型系列和四个下游任务的单个浅 FFN 下投影。我们将该模块称为主导适应模块,并表明其层索引依赖于架构但任务稳定。受这一发现的启发,我们提出了 DomloRA,一种将单个适配器放置在主要适应模块上的放置方法。 DomLoRA 的可训练参数仅为普通 LoRA 的约 0.7%,在各种下游任务(包括指令跟踪、数学推理、代码生成和多轮对话)中平均表现优于它。该方法还改进了其他 LoRA 变体,支持占主导地位的适应模块视角作为实用的放置指南。

重思适配器放置:主导适配模块视角:论文配图
图 1:从广泛布局到主导布局。 Vanilla LoRA 将适配器跨多个层和模块类型放置。 (a)逐层缩减:更少的层数,保留所有模块类型。 (b) 模块类型缩减:模块类型减少,所有层均保留。 (c) 减少为单一主导模块:PAGE 高度集中在一个浅 FFN 向下投影(放大),表明放置在那里的单个接头就足够了。