论文

Miner:挖掘内在掌握度以实现大推理模型的数据高效强化学习

Miner:Mining Intrinsic Mastery for Data-Efficient RL in Large Reasoning Models

模型训练强化学习RLVR

摘要

当前用于大推理模型的无批评强化学习方法在对正同质提示(所有推出都是正确的)进行训练时效率严重低下,导致由于零优势估计而导致浪费。我们为 \uline{M}ine \uline{in}trinsic mast\uline{er}y (Miner) 引入了一种极其简单但功能强大的解决方案,它将策略的内在不确定性重新调整为自我监督的奖励信号,无需外部监督、辅助模型或额外的推理成本。我们的方法开创了两项关键创新:(1) token级焦点贡献归因机制,动态放大关键不确定token的梯度,同时抑制过度自信的token;(2) 自适应优势校准,以无缝集成内在和可验证的奖励。通过对 Qwen3-4B 和 Qwen3-8B 基本模型的六个推理基准进行评估,Miner 在其他四种算法中实现了最先进的性能,与 GRPO 相比,在 Pass@1 中产生了 \textbf{4.58} 绝对增益,在 Pass@K 中产生了 \textbf{6.66} 增益。与其他针对勘探强化的方法的比较进一步揭示了这两项新提出的创新的优越性。这表明,潜在的不确定性利用对于推理模型的高效且可扩展的强化学习训练来说既是必要的也是充分的。

Miner:挖掘内在掌握度以实现大推理模型的数据高效强化学习 配图
图 1:(a) 传统 GRPO 算法由于最高奖励彼此难以区分,产生了相当数量对 RL 更新没有贡献的 rollout。(b) Miner 为每个 rollout 引入内在奖励,注入有益的密集奖励信号,仅用 50% 的训练步数即达到相同的峰值性能,并在 Qwen3-4B-Base 上取得最高 23% 的性能提升。