论文

混合微调:联合零阶与一阶优化的算法和收敛分析

New Hybrid Fine-Tuning Paradigm for LLMs: Algorithm Design and Convergence Analysis Framework

模型训练参数高效训练

摘要

大语言模型(LLM)的微调通常要么采用更新全部模型参数的全量微调,要么采用只调整一小部分参数的参数高效微调(PEFT)。然而两种方法都有固有局限:全量微调计算代价高昂,而PEFT往往难以学习新知识且性能欠佳。为克服这些问题,我们提出一种新颖的混合微调方法,利用零阶与一阶优化方法的组合联合更新LLM与PEFT模块。为分析我们的新算法,我们建立了一个以混合光滑性条件(hybrid smoothness condition)概念为核心的理论框架,用以刻画LLM与PEFT联合训练中优化景观的异质特性。我们对多学习率下reshuffling型SGD算法的收敛性推导了严格的收敛分析,并通过覆盖多种下游任务与模型架构的大量实证研究证明其有效性。在实践方面,我们的结果显示出持续的性能提升,使该方法成为大规模语言模型微调的可行方案。

LLM新型混合微调范式:算法设计与收敛分析框架:论文配图
(a) 在 SST2 数据集(Socher 等人,2013)上训练的 OPT-125M(Zhang 等人,2022)中梯度范数与局部梯度 Lipschitz 常数的对数尺度比较。颜色条表示梯度更新的次数。(b) 不同模块(OPT-125M 和 LoRA (Hu et al., 2021))的梯度 Lipschitz 常数 LL 的比较。基础 LLM 表现出明显更大的梯度更新,需要更小的学习率。图 1:混合微调大语言模型中平滑结构的可视化。这些复杂的特征给传统优化算法的收敛分析带来了新的挑战,促使我们为混合微调方法考虑宽松的平滑条件,即混合平滑条件(定义1)。