论文
学会解决,忘记保留:RLVR 中的正确设置周转率
Learning to Solve, Forgetting to Retain: Correct-Set Turnover in RLVR
摘要
具有可验证奖励的强化学习(RLVR)提高了 大语言模型 的能力,但标题准确性的提升往往掩盖了一个隐藏的成本:随着训练的进行,以前解决的问题悄然变得无法解决。我们将这种现象描述为\emph{正确集转换},表示解决方案获取和回归在掌握的集合上的耦合动态。根据这种观点,保留与收购一起成为明确的优化目标。我们通过分析和经验建立了 \emph{修复窗口原理}:恢复回归提示的成本随着审查延迟而急剧增长,定义了标准 RLVR 管道无法利用的低成本窗口。为了解决这个问题,我们提出了 \textbf{\method{}},一种保留感知的审查机制,可以跟踪掌握的提示并定期将它们重新引入到 \textbf{remind} 先前解决方案的模型中。通过利用预执行轨迹批量替换,\method{} 会产生零额外的执行轨迹开销。使用 Qwen3-VL 和 Qwen2.5-Math 对涵盖图像文本、视频和纯文本任务的 20 个基准进行了评估,\method{} 持续提高了 GRPO、DAPO 和重放基准的性能,展示了跨模式和算法的强大通用性。