论文

当梯度重要性不存在时:GRPO 下自适应 LoRA 排名分配失败

When Gradient Importance Lies: Adaptive LoRA Rank Allocation Fails Under GRPO

模型训练参数高效训练

摘要

LoRA 的自适应排名分配 - 将更多参数分配给重要层,将更少参数分配给不重要层 - 在监督 微调 (SFT) 下持续提高效率。我们测试这种成功是否转移到强化学习,特别是组相对策略优化(GRPO)。在带有 GSM8K 的 Qwen 2.5 1.5B 上使用梯度幅度分析,我们发现,在我们的设置中,它不会:尽管使用相同的参数预算,但与均匀分配相比,比例排名分配的准确性降低了 4.5 个百分点(70.0% 与 74.5%)。我们确定了这种失败背后的两种机制。首先,GRPO 下的梯度景观基本上比 SFT 下更平坦:最大与最小层重要性比仅为 2.17 倍,而 Shi 等人报告的层浓度。 (2024) 对于 SFT(前 30% 的层承载 >80% 的梯度信号)意味着最大/最小比率远高于 10 倍。所有层都携带有意义的梯度信号;没有一个是真正闲着的。其次,我们观察到梯度放大效应:非均匀分配将重要性分布从 2.17 倍扩大到 3.00 倍,从而创建一个正反馈循环,其中高秩层吸收更多梯度,而低秩层逐渐沉默。随机分配控制产生相同的放大(分配的排名和所得梯度份额之间的相关性 r = 0.972),表明排名因果地决定梯度重要性,而不是相反。负结果是单种子、单任务;我们将其作为初步证据,表明梯度重要性不能预测 RL 下的容量需求,并且应谨慎评估 SFT 时代排名分配策略向对齐训练的简单转移。