论文

AdaMeZO:LLM 微调 的 Adam 式零阶优化器,无需维护矩

AdaMeZO: Adam-style Zeroth-Order Optimizer for LLM Fine-tuning Without Maintaining the Moments

模型训练参数高效训练

摘要

微调 LLM 对于各种专用下游任务是必需的,但经典的基于反向传播的 微调 方法需要大量 GPU 内存。为此,最近的一项工作 MeZO 完全依赖前向传递来微调 LLM,显着降低了 GPU 要求,但由于其对损失情况的漠不关心,其代价是收敛速度较慢。标准解决方案(例如 Adam)通过估计一阶和二阶矩并将其存储在内存中来探索损失景观,以引导模型在曲率较低的维度上移动,反之亦然。然而,直接应用 Adam 会抵消 MeZO 的优势,因为它会使内存需求增加两倍。有鉴于此,我们提出了 AdaMeZO,这是一种零阶优化器,它利用 Adam 式的一阶矩和二阶矩估计,而不将它们保留在内存中。我们提出了 AdaMeZO 的理论分析,并通过大量实验证实了 AdaMeZO 的性能,表明 AdaMeZO 可以超越 MeZO,同时需要最多 $70\%$ 的前传球。轨迹可视化证实了 AdaMeZO 适应不同损失情况的能力。