论文
混合微调:联合零阶与一阶优化的算法和收敛分析
New Hybrid Fine-Tuning Paradigm for LLMs: Algorithm Design and Convergence Analysis Framework
摘要
大语言模型(LLM)的微调通常要么采用更新全部模型参数的全量微调,要么采用只调整一小部分参数的参数高效微调(PEFT)。然而两种方法都有固有局限:全量微调计算代价高昂,而PEFT往往难以学习新知识且性能欠佳。为克服这些问题,我们提出一种新颖的混合微调方法,利用零阶与一阶优化方法的组合联合更新LLM与PEFT模块。为分析我们的新算法,我们建立了一个以混合光滑性条件(hybrid smoothness condition)概念为核心的理论框架,用以刻画LLM与PEFT联合训练中优化景观的异质特性。我们对多学习率下reshuffling型SGD算法的收敛性推导了严格的收敛分析,并通过覆盖多种下游任务与模型架构的大量实证研究证明其有效性。在实践方面,我们的结果显示出持续的性能提升,使该方法成为大规模语言模型微调的可行方案。
