论文

基于 LMO 的方法的零阶无参数优化:高效的新方法 微调

Zero-order Parameter-free Optimization for LMO-based Methods: Novel Approach for Efficient Fine-tuning

模型训练参数高效训练

摘要

微调 大语言模型 (LLM) 已成为现代优化的核心应用,使预训练模型能够适应不同的下游任务和特定领域的数据。大规模 微调 的一个主要障碍是反向传播的内存开销,它需要存储激活、梯度和优化器状态。零阶 (ZO) 优化提供了一种节省内存的替代方案,但其性能对步长和平滑参数高度敏感,通常需要昂贵的特定于任务的调整。无参数 (PF) 优化通过调整算法参数来解决这个问题,而无需事先了解与问题相关的常量。此外,大规模 微调 可以受益于几何感知更新,该更新考虑了参数块的异构结构,可以通过利用线性最小化预言(LMO)的方法进行建模。在这项工作中,我们研究了基于 LMO 的 ZO 优化的 PF 自适应,并引入了 $\texttt{AdaNAGED}$,一种统一无梯度训练、自适应调整和非欧几里得更新几何的方法。我们建立收敛保证并使用 $\texttt{OPT}-1.3\mathrm{B}$ 模型在大规模 LLM 微调 任务上验证该方法。