论文

走出舒适区的轻推:面向RLVR的高效策略引导探索

Nudging Beyond the Comfort Zone: Efficient Strategy-Guided Exploration for RLVR

模型训练强化学习RLVR

摘要

可验证奖励强化学习(RLVR)已成为提升大语言模型推理能力的一种可扩展范式。然而,其效果从根本上受探索的限制:策略只能在已经采样过的轨迹上改进。虽然增加rollout数量可以缓解这一问题,但这种暴力扩展的计算代价高昂,而修改优化目标的现有方法对探索内容的控制有限。在本工作中,我们提出NudgeRL,一个在RLVR中实现结构化、多样性驱动探索的框架。我们的方法引入策略推动(Strategy Nudging),让每次rollout以轻量的策略级上下文为条件,在不依赖昂贵oracle监督的情况下诱导多样的推理轨迹。为了从这种结构化探索中有效学习,我们进一步提出一个统一目标,将奖励信号分解为上下文间与上下文内两个分量,并纳入蒸馏目标,把发现的行为迁移回基础策略。实验表明,NudgeRL胜过rollout预算大8倍的标准GRPO,并在五个高难度数学基准上平均优于oracle引导的RL基线。这些结果表明,结构化、上下文驱动的探索可以成为暴力扩展rollout以及基于特权信息的可行性导向方法的高效、可扩展替代方案。代码发布于 https://github.com/tally0818/NudgeRL。

走出舒适区的轻推:面向RLVR的高效策略引导探索:论文配图
图 1:概念:通过战略推动提高探索多样性。 (a) 朴素采样方法(例如 GRPO)经常崩溃为占主导地位的推理模式,限制了推理空间的探索。 (b) NudgeRL introduces Strategy Nudging, which appends lightweight strategy to the input, forcing the model to traverse diverse reasoning modes. (c) 因此,与基线相比,策略助推显着增加了发现的不同推理方法的数量,有效缓解了探索瓶颈。其他详细信息请参见附录 B