论文
BV-Blend:稳定无需价值模型的RLVR训练的历史基线
BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards
摘要
以组相对策略优化(GRPO)为代表的可验证奖励无需价值模型的强化学习(RLVR)避免训练价值函数(价值模型)——相对基于价值模型的PPO管线降低对齐大语言模型的内存与计算开销。但GRPO式优势估计依赖提示局部(提示组内)奖励统计——可能不稳定。特别是当提示组内全部rollout获得相同奖励时——组内奖励方差为零——组归一化对该组产生零优势——阻碍二值验证器冷启动机制下的学习。我们引入BV-Blend——无需价值模型的框架——通过组合提示局部自策略统计与语义簇条件化的历史矩来稳定优势估计。BV-Blend为每簇维护EMA追踪的奖励矩——从均值标准误(SEM)代理导出置信权重——并用该权重把历史与提示局部基线及方差统计混合为PPO式裁剪更新的标准化优势。可验证推理基准上的实验表明BV-Blend改进训练稳定性与性能——并在组归一化方法可能停滞的机制中保持稳健。
