论文
二元奖励和强化学习:基本挑战
Binary Rewards and Reinforcement Learning: Fundamental Challenges
摘要
具有可验证奖励的强化学习 (RLVR) 已成为改进语言模型推理的标准方法,但使用 RLVR 训练的模型经常遭受多样性崩溃:虽然单样本准确性提高,但多样本覆盖率下降,有时低于基本模型。我们基于二元奖励的特性对这种现象进行了结构性解释。二元奖励为策略梯度方法带来了根本性的退化:最大化预期奖励的分布集是无限的,没有明显的元素。 KL-control 通过在 $β\to 0$ 的限制下选择过滤模型 $p_*:=a(\cdot\mid\mathcal{Y}_1)$ 来解决这种简并性——以有效性为条件的基本模型——这是在 KL 散度中最接近基本模型的唯一完全有效的分布。这种选择通过非平凡的不对称性进行操作:倾斜分布 $p_{[β]}\propto a(y)\,e^{v(y)/β}$ 在前向 KL 中收敛到 $p_*$,即 $β\to 0$,但 $p_*$ 不能用作直接优化目标,因为 $\mathrm{KL}(q\,\|\,p_*)$ 对于任何完全支持策略 $q$ 都是无限的。我们开发了将超参数 $β$ 与更可解释的目标有效性 $μ$ 相关的明确公式。在模型错误指定(典型的实际情况)下,减少 $β$ 的压力驱使优化器在少量有效输出上实现高度集中的分布,随着 $β$ 的减少而崩溃,而不是过滤后的模型。我们在玩具自回归实验中说明了这种机制,并讨论了直接针对 $p_*$ 的替代分歧(如 \citet{kruszewski_whatever_2026} 所追求的经验)如何通过奖励覆盖 $p_*$ 的支持而不是专注于高有效性输出来避免这种失败模式。