论文
Miner:挖掘内在掌握度以实现大推理模型的数据高效强化学习
Miner:Mining Intrinsic Mastery for Data-Efficient RL in Large Reasoning Models
摘要
当前用于大推理模型的无批评强化学习方法在对正同质提示(所有推出都是正确的)进行训练时效率严重低下,导致由于零优势估计而导致浪费。我们为 \uline{M}ine \uline{in}trinsic mast\uline{er}y (Miner) 引入了一种极其简单但功能强大的解决方案,它将策略的内在不确定性重新调整为自我监督的奖励信号,无需外部监督、辅助模型或额外的推理成本。我们的方法开创了两项关键创新:(1) token级焦点贡献归因机制,动态放大关键不确定token的梯度,同时抑制过度自信的token;(2) 自适应优势校准,以无缝集成内在和可验证的奖励。通过对 Qwen3-4B 和 Qwen3-8B 基本模型的六个推理基准进行评估,Miner 在其他四种算法中实现了最先进的性能,与 GRPO 相比,在 Pass@1 中产生了 \textbf{4.58} 绝对增益,在 Pass@K 中产生了 \textbf{6.66} 增益。与其他针对勘探强化的方法的比较进一步揭示了这两项新提出的创新的优越性。这表明,潜在的不确定性利用对于推理模型的高效且可扩展的强化学习训练来说既是必要的也是充分的。
