论文

RoSA:记忆-高效微调的旋转稀疏自适应

RoSA: Rotational Sparse Adaptation for Memory-Efficient Fine-Tuning

模型训练参数高效训练

摘要

参数高效微调 (PEFT) 通过将训练集中在一个小的参数子集上,降低了适应基础模型的成本。作为对这一想法的补充,我们引入了 RoSA(旋转稀疏适应),它将适应范围一次缩小到一个子集的层。 RoSA 在整个训练中冻结靠近输入的较低层,并在后面的层上旋转可训练块,逐渐增加靠近输入的冻结层的数量。此设计减少了优化器状态记忆,缩短了反向传播,如果最后冻结层的激活被缓存,甚至可以缩短前向传播。由于 RoSA 与可训练参数化的选择正交,因此它可以与每个活动块内的 PEFT 方法或稀疏优化器相结合。跨多个LLM架构和任务的实验表明,RoSA 降低了记忆峰值,同时保持了强大的微调性能。

RoSA:记忆-高效微调的旋转稀疏自适应的原论文方法或结果图
图 1:RoSA 训练时间表。 RoSA 冻结一个大的输入侧前缀,保持输出侧锚点处于活动状态,并在后面的层中旋转一个连续的可训练组。冻结前缀会删除早期层的优化器状态和参数梯度,缩短后向路径,并启用固定前缀的未来激活缓存。