论文

混合-LoRA:桥接完整的 微调 和 后训练 的低秩适应

Hybrid-LoRA: Bridging Full Fine-Tuning and Low-Rank Adaptation for Post-Training

模型训练参数高效训练

摘要

后训练 对于使 大语言模型 (LLM) 适应复杂的下游行为(包括指令遵循、偏好对齐和多步推理)至关重要。最近,具有可验证奖励的强化学习 (RLVR) 已成为一种特别有效的 后训练 范式,用于提高推理能力,其无批评算法(例如 GRPO 和 GSPO)可实现可扩展的优化。然而,具有完整 微调 (FFT) 的 RLVR 后训练 需要大量 GPU 内存,并且会产生高昂的训练成本。尽管参数高效的 微调 (PEFT) 方法,例如低秩适应 (LoRA),可以有效降低计算成本,但与 后训练 中的完整 微调 相比,它们在复杂推理任务中通常存在明显的性能差距。在本文中,我们提出了 Hybrid-LoRA,这是一种高效的混合 后训练 框架,它有选择地将完整的 微调 应用于不太适合低秩适应的一小部分模块,同时使用 LoRA 调整其余组件。我们引入了一种新颖的 Hybrid-LoRA Score,根据固定参数预算下候选模块对低秩适应的敏感性对候选模块进行排名。实验表明,Hybrid-LoRA 在 微调 模块预算的 10% 下与 微调 的全部性能非常匹配,而其余候选模块则由 LoRA 调整,始终优于四个最先进的 PEFT 后训练 基线,与最佳基线相比,实现了高达 5.65% 的改进,平均提高了 4.36%。