论文

通过推理的结构性收敛检测RLVR训练数据

Detecting RLVR Training Data via Structural Convergence of Reasoning

模型评测模型训练强化学习评测方法与指标RLVR

摘要

可验证奖励强化学习(RLVR)是训练现代推理模型的核心,但不公开的训练数据引发了对基准污染的担忧。与使用词元级概率优化模型的预训练方法不同,RLVR基于来自自生成推理轨迹的奖励反馈微调模型,使传统的基于似然的检测方法效果减弱。我们证明RLVR会诱导一种独特的行为特征:在RLVR训练中遇到过的提示会产生更僵硬、更相似的生成,而未见过的提示保留更大的多样性。我们提出Min-kNN Distance,一个简单的黑盒检测器,它通过为给定提示采样多个补全并计算最小的k个近邻编辑距离的平均值来量化这种坍缩。Min-kNN Distance无需访问参考模型或词元概率。在多个RLVR训练的推理模型上的实验表明,Min-kNN Distance能可靠地区分RL见过的样本与未见样本,并优于现有的成员推断与RL污染检测基线。

通过推理的结构性收敛检测RLVR训练数据
图1:我们研究 RLVR 如何在推理轨迹中诱导结构性收敛。左:RLVR 将多样的推理路径压缩为共享的结构模式。中:多个补全聚集为少数几种推理结构。右:Min- k k NN Distance 通过最近邻编辑距离量化这种坍缩,对见过的提示给出低值,对未见过的提示给出高值。