论文

无需训练 RLVR 数据选择的单次轨迹采样隐藏状态动态

Single-Rollout Hidden-State Dynamics for Training-Free RLVR Data Selection

模型训练合成数据

摘要

具有可验证奖励的强化学习(RLVR)可以从很少的训练实例中产生巨大的推理收益,但其对使用哪些实例的强烈敏感性使得数据选择成为中心瓶颈。大多数现有的选择管道依赖于训练时优化信号和/或需要在大型候选池上获得可验证的奖励或 真值 答案,这是昂贵的,并且在专门领域中通常不可行。我们在这样的环境中研究 RLVR 数据选择:必须在任何 RL 训练之前进行选择,并且没有对整个池进行标签或奖励评估。我们提出了 SHIFT,一种仅基于推理时间隐藏状态动态的一次性 无需训练 选择器。对于每个候选实例,SHIFT 运行单个确定性推理轨迹采样,并计算推理引发的表示偏移 (RIRS) 作为开始到结束的隐藏状态增量。 SHIFT 使用 RIRS 幅度作为实例效用的轻量级代理,并通过 RIRS 增强特征空间中的质量加权最远优先 CoreSet 过程强制覆盖,生成可扩展到大型未标记池的紧凑子集。在超低预算下的数学推理和医学 QA 基准中,SHIFT 始终优于 无需训练 多样性和难度/不确定性基线,提高了域内准确性并转移到更难的评估设置。消融表明,基于 RIRS 的覆盖范围和质量加权有助于互补增益,分析表明 RIRS 不能用简单的输入/输出长度统计来解释。代码可在 github.com/JianghaoWu/SHIFT 获取。