论文

ThinkPrior:以无需目标策略预采样的难度先验选择RLVR冷启动提示

ThinkPrior: Zero-Rollout Difficulty Priors for Cold-Start Prompt Selection in RLVR

模型训练强化学习RLVR

摘要

在通过组相对策略优化(GRPO)训练的可验证奖励强化学习(RLVR)中,这里研究的无 KL 奖励优势项取决于组内奖励变化。如果一个组中的所有轨迹采样都是正确的或全部都是错误的,那么它们相对于组的优势同样为零;这些零优势沉默群体不提供奖励优势梯度,但统一抽样将 39% 的运行轨迹采样花费在它们身上。基于历史的提示选择必须首先使用目标策略轨迹采样来估计难度,从而造成轨迹采样浪费的冷启动;相反,ThinkPrior 在一次离线传递中使用外部锚点在第一次目标策略轨迹采样之前构建零轨迹采样难度。验证者评分的锚点通过率为 Beta 后验提供外部锚点初始化; ThinkPrior 根据预期的可学习性进行选择,然后根据训练结果进行更新,既不改变损失也不改变优化器。在跨越 16 个种子的 Qwen2.5-Math-7B 上,ThinkPrior 将早期沉默组的数量减少了一半以上,并将第 30 步中浪费的轨迹采样减少了近五分之一,而我们发现最终准确性没有差异。在这个 250 提示池中,固定预算结果是重新分配而不是净节省。测得的 ThinkPrior+DAPO 组合将生成的轨迹采样减少了 10.6%,同时两个分支保留相同的 3840 轨迹采样更新预算。先验要求在第一次选择之前不需要轨迹采样目标政策,但后验则使用目标政策结果。