论文

同策略 优化中验证者引发的支持重塑

Verifier-Induced Support Reshaping in On-Policy Optimization

模型评测模型行为与机制分析

摘要

我们证明,具有可验证奖励(RLVR)的 同策略 强化学习可以改善当前目标,同时使后续目标的成功行为太罕见而无法采样和强化。我们将这种验证者引发的支持重塑称为有效的可奖励支持,并将其定义为在固定的轨迹采样预算内可达到的成功轨迹。在两个模型系列中,我们通过重复验证者评分采样以及数学推理和约束指令遵循的双向训练(包括与相反验证者的顺序训练)来研究这种效应。 Math-RLVR 提高了平均指令遵循成功率,但减少了重复采样下任何成功响应的提示数量。在使用 Qwen3-8B-Base 的 IFEval 上,pass@1 上升了 6.5 个百分点,而 best@32 下降了 9.8 个百分点,模型和 IF 基准测试中也出现了相同的差异。相反,IF-RLVR 将数学响应从逐步开放转向直接答案,降低了抽样预算中的 best@k,并减少了后续 Math-RLVR 的奖励变化。词元分布分析和受控开放干预表明,这些变化集中在前几个响应词元中。 RLVR 主要对基本策略中已有的空缺进行重新排序,并且所选空缺会因果性地影响数学可搜索性。测试的参考策略约束、路由先验和 同策略 蒸馏 仅部分保留跨任务支持; MathIF 和 ReasonIF 表明,边际收益仅部分转化为正确且遵循约束的响应。因此,端点改进并不能保证 同策略 优化下未来的可训练性或联合能力。代码可在 https://github.com/sylvain-wei/VISR 获取