论文

LLM RLVR 加速的低秩优化轨迹建模

Low-rank Optimization Trajectories Modeling for LLM RLVR Acceleration

模型训练强化学习

摘要

最近,大语言模型(LLM)的可验证奖励扩展强化学习(RLVR)已成为显着提高模型能力的有效训练范式,这需要引导模型进行广泛的探索和学习,导致大量的计算开销,成为一个关键挑战。为了减少训练步骤的数量,先前的工作对模型参数进行线性外推。然而,对于 RLVR 训练期间模型参数更新的动态仍知之甚少。为了进一步研究LLM在RLVR训练过程中的演化,我们进行了实证实验,发现模型的rank-1子空间并不是线性演化的,并且在LoRA训练过程中其对原始参数的优势被进一步放大。基于上述见解,我们提出了低秩轨迹的 \textbf{N}online \textbf{Ext}rapolation (\textbf{NExt}),这是一种以非线性方式建模和外推低秩参数轨迹的新颖框架。具体来说,我们首先使用LoRA训练模型,并在多个训练步骤中提取参数差异的rank-1子空间,然后将其用于后续的非线性外推。随后,我们利用提取的rank-1子空间来训练预测器,该预测器可以对RLVR期间参数更新的轨迹进行建模,然后执行预测扩展过程来外推模型参数,从而实现RLVR的加速。为了进一步研究和理解 NExt,我们进行了全面的实验,证明了该方法的有效性和鲁棒性。我们的方法将计算开销减少了大约 37.5%,同时保持与各种 RLVR 算法和任务的兼容性。我们在 https://github.com/RUCAIBox/NExt 中发布了我们的代码。