论文
MpSub:大语言模型 的无导数 微调 的动量 $p$ 维子空间信赖域方法
MpSub: A Momentum $p$-Dimensional Subspace Trust-Region Method for Derivative-Free Fine-Tuning of Large Language Models
摘要
大语言模型 的全参数 微调 具有大量内存成本,因为反向传播存储激活和梯度。零阶优化通过估计损失评估的更新方向来避免这种情况,但现有方法需要调整每个模型和任务的敏感学习率。我们提出动量 $p$ 维子空间信赖域方法 (MpSub)。在每次迭代中,MpSub 在 $p$ 维子空间内进行搜索:一个方向保留最近接受的步骤的历史动量,而其余方向则通过新的随机采样进行探索。子空间梯度是通过中心差来估计的,试验步骤是根据线性信任域模型计算的,并且信任域半径根据预测和观察到的损失减少之间的一致性进行调整,从而消除了学习率。对于 LLM 微调,迭代内的评估共享一个小批量,并且仅使用前向传递从种子就地重新生成方向。对于非正交高斯方向下的平滑确定性目标,我们限制有限差分误差,量化子空间捕获的梯度能量,并证明 $\lim_{k\to\infty} \|\nabla f(x_k)\|_2 = 0$ 在受保护的半径更新下几乎肯定。在 8,400 个训练目标前向传递的匹配预算下,我们在 CommitmentBank 上对 OPT-125M 和 OPT-350M 进行了微调。在两种模型大小下使用相同的预设参数,MpSub 在三个种子上获得的平均测试精度为 0.673 和 0.690,与调整后的 MeZO (0.685) 匹配,无需任何学习率搜索。