论文

RLVR 数据集以及在哪里找到它们:跟踪数据沿袭以获得更好的训练数据

RLVR Datasets and Where to Find Them: Tracing Data Lineage for Better Training Data

模型训练强化学习合成数据RLVR

摘要

由于现有数据集之间的谱系不明确,可验证奖励强化学习(RLVR)数据集的激增加剧了来源崩溃。为了弥合这种分散的 RLVR 数据格局,我们提出了通过谱系感知搜索进行原子源追踪 (ATLAS),这是一个用于将 RLVR 数据集追溯到其原子源的系统框架,将 145 万个实例中的 99.7% 以上归因于 20 个原子源。我们的分析表明,大多数 RLVR 数据集都是一小组共享上游源的变体,很少引入真正的新数据,并且许多数据集面临数据污染风险。这些发现自然会促使我们策划一个新的 RLVR 数据集 DAPO++,并从谱系感知的角度对现有数据集进行基准测试。为此,我们提出源级反事实归因(SCA)作为指导原则,以利用集中的学习信号来策划净化的训练数据集。本质上,SCA 通过将每个原子源 RL 检查点与共享基础模型进行比较来衡量样本的边际效用。基于这些归因信号,我们进一步设计了一个与下游 RLVR 性能密切相关的复合数据集质量得分 Q。 Qwen3 系列模型的实验验证了 DAPO++ 持续提高了测试基准的性能,而 Q 则可靠地预测了下游 RLVR 训练的有效性。我们的代码和数据可在 https://github.com/Celine-hxy/ATLAS 获取。