论文

BV-Blend:稳定无需价值模型的RLVR训练的历史基线

BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards

模型训练强化学习RLVR

摘要

以组相对策略优化(GRPO)为代表的可验证奖励无需价值模型的强化学习(RLVR)避免训练价值函数(价值模型)——相对基于价值模型的PPO管线降低对齐大语言模型的内存与计算开销。但GRPO式优势估计依赖提示局部(提示组内)奖励统计——可能不稳定。特别是当提示组内全部rollout获得相同奖励时——组内奖励方差为零——组归一化对该组产生零优势——阻碍二值验证器冷启动机制下的学习。我们引入BV-Blend——无需价值模型的框架——通过组合提示局部自策略统计与语义簇条件化的历史矩来稳定优势估计。BV-Blend为每簇维护EMA追踪的奖励矩——从均值标准误(SEM)代理导出置信权重——并用该权重把历史与提示局部基线及方差统计混合为PPO式裁剪更新的标准化优势。可验证推理基准上的实验表明BV-Blend改进训练稳定性与性能——并在组归一化方法可能停滞的机制中保持稳健。

BV-Blend:面向可验证奖励无评论家RL稳定性的不确定性加权历史基线:论文配图
图 1:BV-Blend 概述。对于每个提示 q(m)q^{(m)},我们使用行为策略对 GG 轨迹 {τi(m)}\{\tau_{i}^{(m)}\} 进行采样,并获得验证者奖励 {Ri(m)}\{R_{i}^{(m)}\}。我们计算即时局部统计量 (μ𝒢(m),σ𝒢(m))(\mu_{\mathcal{G}}^{(m)},\sigma_{\mathcal{G}}^{(m)}),嵌入 q(m)q^{(m)},并将其分配给语义簇 k(m)k^{(m)}。使用更新前的 EMA 矩 (μhist​(k),vhist​(k),Nkeff)(\mu_{\mathrm{hist}}(k),v_{\mathrm{hist}}(k),N_{k}^{\mathrm{eff}}),我们计算基于 SEM 的置信度 wkw_{k} (等式(9);冷启动:wk=0w_{k}{=}0对于看不见的簇),混合基线和方差统计以获得(b(m),s(m))(b^{(m)},s^{(m)})(方程(10)),并形成优势AiBV,(m)A_{i}^{\mathrm{BV},(m)}(方程(11))进行PPO式更新。 EMA 矩在更新后使用当前批次进行更新。