论文

用框架(Frame)微调Transformer模型

Fine-Tuning of Transformer models with Frames

模型训练参数高效训练

摘要

低秩适应(LoRA)等参数高效微调(PEFT)策略是微调大规模预训练模型的有效方案;但其内存需求随模型规模扩展,为$\mathcal{O}(dr)$,其中d是模型隐藏维度,r是秩。我们的方案FrameFT在融合框架(Fusion Frame)基下用稀疏系数矩阵对参数更新$ΔW$建模。融合框架可以算法化生成并在模型层间共享,从而实现非常高效的更新。只需存储/优化基展开的稀疏系数,降低内存占用。FrameFT中系数矩阵的稀疏结构和融合框架自身的稀疏性带来巨大的计算收益,我们的分析给出了形式化的收敛结果。我们在一系列监督微调基准上评估该想法,聚焦语言任务,但也报告了在视觉模型上的应用。实验表明,FrameFT达到与最先进PEFT技术相当或更好的性能,而所需可训练参数少得多。