论文

GeoRA 为可验证奖励强化学习设计低秩适配

GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR

模型训练模型评测强化学习参数高效训练模型能力评测RLVR

摘要

可验证奖励强化学习(RLVR)对提升大规模推理模型至关重要。然而,PiSSA、MiLoRA等现有参数高效方法面向监督微调(SFT)设计,没有考虑RLVR特有的优化动态与几何结构。直接应用这些方法会导致谱坍缩和优化不稳定,严重限制模型性能。另一些利用更新稀疏性的方法则因非结构化计算,在现代硬件上遭遇效率瓶颈。我们提出几何感知低秩适配GeoRA,利用强化学习更新子空间的各向异性和可压缩性。在受几何约束的子空间内,GeoRA通过奇异值分解(SVD)提取主方向来初始化适配器,并冻结残余分量。这既保留预训练几何结构,又可通过稠密算子高效利用GPU。Qwen和Llama上的实验表明,GeoRA缓解了几何不匹配造成的优化瓶颈,在关键数学基准上持续优于既有低秩基线并达到最佳结果,同时在域外任务上表现出更好的泛化能力和对灾难性遗忘的抵抗力。

GeoRA 为可验证奖励强化学习设计低秩适配:适配器初始化与前向架构的比较。LoRA采用标准初始化,对原权重矩阵W进行低秩适配;PiSSA从W的主成分初始化适配器。GeoRA则从几何约束
图1:适配器初始化与前向架构的比较。LoRA采用标准初始化,对原权重矩阵W进行低秩适配;PiSSA从W的主成分初始化适配器。GeoRA则从几何约束矩阵W_Geo初始化,适配目标与W不同;前向过程中,冻结的残差矩阵与可训练适配器并行,作为主成分的稳定性锚点。