论文
DataFlex-RL:RLVR 数据策略的评估平台
DataFlex-RL: An Evaluation Platform for RLVR Data Policies
摘要
具有可验证奖励的强化学习 (RLVR) 的数据策略决定了使用哪些采样轨迹、它们的加权强度以及哪些领域对后续训练批次有贡献。我们推出了 DataFlex-RL,这是一个评估平台,用于在通用 GRPO 配方下比较这些选择。我们的主要实验使用 Qwen2.5-7B-Base 和 12 个数学、逻辑和科学基准评估 12 个匹配种子的 13 个配置。与未经训练的检查点相比,统一 GRPO 将域平衡平均准确率提高了 7.76 个百分点。八种采样选择或重新加权方法中没有一种能够实现相对于均匀采样排除零的成对 95% 置信区间,并且三种自适应混合中没有一种在相同精度水平上优于固定的相等混合。 Llama-3.1-8B-Base 上经过修正的 12 种子扩展将附加方法置于与原始对照相同的分数范围内,但在观察到的平均性能方面并未揭示出一致的获胜者。我们还通过使用数学密集的六基准摘要(包括五个数学基准和 GPQA-Diamond 但没有逻辑基准)重新评分 9 个 Qwen2.5-7B-Instruct 运行来量化评估灵敏度,并将其与域平衡的 12 基准摘要进行比较。由此产生的排名呈负相关,相关系数为-0.33,而保留所有 12 个基准的摘要基本一致。在此处研究的受控设置中,更改数据策略会显着改变训练过程,但不会比统一训练产生可重复的改进。