论文

通过变分学习进行 RLVR 参数探索

Parameter Exploration for RLVR via Variational Learning

模型训练强化学习

摘要

长期以来,探索一直是强化学习研究的焦点。最近,越来越多的证据表明,它也是 LLM 强化学习配方中的重要成分,可以显着影响下游性能。许多现有方法控制动作空间中的探索,例如使用温度缩放。然而,这些方法不能重新排序标记,而只能影响输出分布的方差。这限制了探索并可能导致分歧或训练停滞。在这里,我们研究参数空间探索,其中执行轨迹是通过从后验中采样不同的策略来生成的,每个策略可能探索不同的执行轨迹。那么,对更少或更多多样化策略进行抽样是对探索的补充控制杠杆。我们引入了一系列称为扰动参数策略优化(3PO)的方法,它们使用不同的采样策略和不同的执行轨迹分组来进行奖励估计。在 OLMo-3-1025-7B 和 Qwen2.5-Math-7B 上跨数学推理和代码生成任务的实验表明,这些方法以几乎相同的 FLOP 成本持续提高了标准 GRPO 的平均下游性能。此外,与 GRPO 和动作空间基线相比,使用多个参数样本在训练期间始终会产生更少的零优势组和畸形或不正确的执行轨迹。总的来说,我们的工作提供了证据,表明参数空间探索可以改善 LLM 的强化学习。