论文
RLVR 中低秩适应的几何保留正交初始化
Geometry-Preserving Orthonormal Initialization for Low-Rank Adaptation in RLVR
摘要
低秩自适应 (LoRA) 及其变体在监督 微调 (SFT) 范例下实现了 大语言模型 的参数高效 微调。然而,它们在具有可验证奖励的强化学习(RLVR)下的功效和行为尚不清楚。特别是,两个结构初始化的 LoRA 变体 PiSSA 和 MiLoRA 在 SFT 下的性能优于标准 LoRA,但在 RLVR 下的性能却低于标准 LoRA,甚至可能表现出训练不稳定。这些观察结果表明,如何初始化 RLVR 中的低秩矩阵仍不清楚。在这项工作中,我们对 RLVR 中的 LoRA 进行了理论分析,表明正交初始化实现了 LoRA 结果与完整 微调 之间的最小差距。在这一见解的指导下,我们提出了 RLVR 中低秩自适应的几何保持正交初始化,从而产生了两个新的变体:RLPO 和 RLMO。数学推理基准实验表明,与 PiSSA 和 MiLoRA 相比,所提出的正交初始化稳定了 RLVR 训练,并且优于标准 LoRA。最后,我们对 LoRA 初始化的统一分析也解释了为什么 PiSSA 和 MiLoRA 在 RLVR 中表现不佳,这可能是独立的兴趣。代码和检查点可在 https://github.com/Richard-ZZZ/geometry-preserving-orthonormal-init-rlvr 上公开获取。