论文
通过推理的结构性收敛检测RLVR训练数据
Detecting RLVR Training Data via Structural Convergence of Reasoning
摘要
可验证奖励强化学习(RLVR)是训练现代推理模型的核心,但不公开的训练数据引发了对基准污染的担忧。与使用词元级概率优化模型的预训练方法不同,RLVR基于来自自生成推理轨迹的奖励反馈微调模型,使传统的基于似然的检测方法效果减弱。我们证明RLVR会诱导一种独特的行为特征:在RLVR训练中遇到过的提示会产生更僵硬、更相似的生成,而未见过的提示保留更大的多样性。我们提出Min-kNN Distance,一个简单的黑盒检测器,它通过为给定提示采样多个补全并计算最小的k个近邻编辑距离的平均值来量化这种坍缩。Min-kNN Distance无需访问参考模型或词元概率。在多个RLVR训练的推理模型上的实验表明,Min-kNN Distance能可靠地区分RL见过的样本与未见样本,并优于现有的成员推断与RL污染检测基线。
