论文

超越 LoRA 与完整 微调:LLM 适应的梯度引导优化器路由

Beyond LoRA vs. Full Fine-Tuning: Gradient-Guided Optimizer Routing for LLM Adaptation

模型训练参数高效训练

摘要

最近有关 微调 大语言模型 的文献凸显了一场根本性的争论。虽然完整 微调 (FFT) 提供了更大的表征可塑性,但低秩适应 (LoRA) 可以匹配或超越 FFT 性能,同时限制对低秩空间的更新,并可能从额外的正则化中受益。通过对不同任务(SQL、医学 QA 和反事实知识)和不同语言模型(Gemma-3-1B、Qwen2.5-1.5B 和 Qwen2.5-3B)的实证评估,我们观察了这两种趋势,并发现更好的静态架构取决于任务和模型。谱和截断分析进一步表明,仅端点可压缩性并不能解释这些任务差异,表明任务得分敏感性和约束优化轨迹是可能的解释。为了应对这一挑战,我们提出了 LoRA 和 Full (MoLF) 微调 的混合,这是一个统一的框架,可以在两种训练体系之间进行连续导航。 MoLF 在优化器级别动态路由 FFT 和 LoRA 之间的更新,以确保在整个训练过程中两位专家都能获得准确的梯度信号,而只有选定的专家才能更新其权重。对于内存受限的环境,我们还引入了 MoLF-Efficient,它会冻结基本权重,并且仅在一对可能不同级别的 LoRA 专家之间路由更新。我们的评估显示,在九个测试设置中,MoLF 比 FFT 和 LoRA 的更好者提高了 1.5 个百分点,而 MoLF-Efficient 在九个设置中的八个中优于 AdaLoRA 和 AdaMix,在 Fact 上比更强的基线提高了 11.70百分点,在 Med 上提高了 3.13,在 SQL 上提高了 2.98。