论文
何时停止重用:样本高效 RLVR 的动态梯度门控
When to Stop Reusing: Dynamic Gradient Gating for Sample-Efficient RLVR
摘要
带可验证奖励的强化学习 (RLVR) 已成为 大语言模型 (LLM) 中高级推理的主导范式,但采样轨迹样本的获取成本高昂,使得样本效率成为关键瓶颈。一种自然的补救措施是重复使用每个 rollout 批次进行多次梯度更新,这是经典强化学习中的标准做法。然而在 RLVR 中,这放大了策略转变,导致性能严重下降。及早检测降解的发生以停止重复使用仍然是一个开放且具有挑战性的问题。我们通过识别 \textit{不成比例的权重发散 (DWD)} 现象来缩小这一差距:性能下降与 \texttt{lm\_head} 权重变化的急剧激增同步,而中间层保持稳定。根据经验,我们验证 DWD 在不同的 LLM 和任务中一致出现。从理论上讲,我们证明(i)有害梯度集中在 \texttt{lm\_head} 处,而中间层在结构上减弱,(ii)\texttt{lm\_head} 梯度范数限制了策略分歧的下限。这些结果将 \texttt{lm\_head} 梯度范数确立为灾难性政策转变的有原则的实时信号。在这一见解的指导下,我们提出了 \textit{Dynamic Gradient Gating (DGG)},这是一种轻量级干预措施,可以实时监控 \texttt{lm\_head} 梯度范数,并在有害梯度破坏优化器之前拦截它们。 DGG 始终匹配或超过标准一次性基线,在数学、ALFWorld、WebShop 和搜索增强 QA 任务中实现高达 2.93\times$ 的样本效率和 2.14\times$ 的挂钟加速。