论文

PoLoRA:预条件正交化 LoRA 优化器

PoLoRA: A Preconditioned Orthogonalized LoRA Optimizer

模型训练参数高效训练

摘要

低秩自适应 (LoRA) 通过向每个权重矩阵添加参数化为两个矩阵乘积的可训练低秩更新,使微调 大语言模型 变得更便宜。这些矩阵通常使用 Adam 进行训练,Adam 将它们视为参数的单个平面向量,并忽略 LoRA 的矩阵和乘积结构。将矩阵感知优化器(例如 Muon)应用于每个因子并不能始终优于 Adam,并且并行工作中提出的产品感知 Muon 变体也没有持续改进。为了实现一致的增益,我们引入了 PoLoRA,这是一种由三个要素构建的预处理正交化 LoRA 优化器:产品感知的频谱更新方向、通过控制每个样本损失变化得出的曲率预处理以及控制因子和合并更新大小的幅度规则。我们在从 1B 到 8B 参数的模型的代码和数学指令调优数据集上评估 PoLoRA,发现它以少 1.2-1.7 倍的步骤达到了通过调优 Adam 实现的最终保留损失,同时每步开销最多增加 3%。与 Adam 相比,PoLoRA 对学习率的敏感度也较低,并且其最优学习率在各个等级之间是稳定的。