论文
LoRA 支架策略优化 (LSPO):一种采样时间低秩支架,用于在零奖励悬崖提示上恢复强化学习梯度
LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts
摘要
用于数学推理的可验证奖励 (RLVR) 的强化学习存在结构性盲点:在“悬崖”提示(组中每个采样的生成轨迹都失败的提示)上,组归一化优势完全相同为零,因此 GRPO 在模型能力前沿的提示上不会精确产生梯度。我们引入 LoRA 支架策略优化 (LSPO),这是一种恢复丢失梯度的采样时间机制。每个 RL 步骤,LSPO 都会检测悬崖提示,通过 真值 解决方案上的简短监督步骤来安装小型低秩 (LoRA) 适配器,使用基础加适配器模型重新滚动悬崖,通过重要性采样校正将现在成功的完成结果拼接回 RL 批次中,并单独在基础上执行 GRPO 步骤;适配器仅接收监督梯度并在检查点被丢弃,产生仅基础模型。在使用 DeepSeek-R1-Distill-Qwen-1.5B 的 DeepMath-103K 上,在匹配的 1000 步报告范围内对每臂 n=5 配对种子进行评估,LSPO 的 5 种子均值在所有 16 个(基准、pass@k)单元格上匹配或超过 DAPO 基线(15 个严格获胜和一个精确平局),在 AIME24/pass@4 上增益高达 +10.7 分, AIME24 和 AIME26 在 pass@16 上+6.7 分,在 MATH500/pass@1 上+2.4 分; 16 个单元的平均改进为 +3.8 个点。