论文

GPart:通过全局参数分区的端到端等距 微调

GPart: End-to-End Isometric Fine-Tuning via Global Parameter Partitioning

模型训练参数高效训练

摘要

低秩适应 (LoRA) 已成为大规模深度学习模型参数高效 微调 (PEFT) 的主导范例。然而,它的双线性参数化导致了参数依赖的几何形状:从可训练参数到权重更新的映射通常不保持距离。将低维向量投影到 LoRA 参数空间的相关方法(例如 Uni-LoRA)提高了参数效率,但后续的双线性映射打破了端到端等距。我们提出了 GPart(全局分区 微调),这是一种高参数效率的 微调 方法,它通过稀疏、等距划分矩阵将 $d$ 维可训练向量直接映射到完整权重空间。 GPart 保留了固定的全局参数共享先验,同时删除了基于 LoRA 的方法使用的额外低秩重建。这产生了一个简单的参数化,具有单个主要超参数($d$)、精确的端到端等距以及由可训练向量和随机种子组成的最小检查点表示。 GPart 建立在完整权重空间的随机低维子空间内有效 微调 的前提下,不需要低秩矩阵分解。在自然语言理解、计算机视觉和数学推理基准方面,GPart 以超低参数预算匹配或改进了现有的 PEFT 方法。除了提供数学上的易处理性和内存效率之外,GPart 的直接线性参数化还简化了模型选择,并为紧凑的适配器组合铺平了道路。总体而言,GPart 在小参数预算下为 微调 提供了一种优雅且有竞争力的替代方案,在可训练坐标和权重空间更新之间具有固定且可预测的几何形状。