论文
走出舒适区的轻推:面向RLVR的高效策略引导探索
Nudging Beyond the Comfort Zone: Efficient Strategy-Guided Exploration for RLVR
摘要
可验证奖励强化学习(RLVR)已成为提升大语言模型推理能力的一种可扩展范式。然而,其效果从根本上受探索的限制:策略只能在已经采样过的轨迹上改进。虽然增加rollout数量可以缓解这一问题,但这种暴力扩展的计算代价高昂,而修改优化目标的现有方法对探索内容的控制有限。在本工作中,我们提出NudgeRL,一个在RLVR中实现结构化、多样性驱动探索的框架。我们的方法引入策略推动(Strategy Nudging),让每次rollout以轻量的策略级上下文为条件,在不依赖昂贵oracle监督的情况下诱导多样的推理轨迹。为了从这种结构化探索中有效学习,我们进一步提出一个统一目标,将奖励信号分解为上下文间与上下文内两个分量,并纳入蒸馏目标,把发现的行为迁移回基础策略。实验表明,NudgeRL胜过rollout预算大8倍的标准GRPO,并在五个高难度数学基准上平均优于oracle引导的RL基线。这些结果表明,结构化、上下文驱动的探索可以成为暴力扩展rollout以及基于特权信息的可行性导向方法的高效、可扩展替代方案。代码发布于 https://github.com/tally0818/NudgeRL。
