论文

极稀疏监督激励推理能力

Extremely Sparse Supervision Incentivizes Reasoning Ability

模型训练强化学习奖励建模与过程监督RLVR

摘要

大语言模型通过有效的后训练展现出日益强大的推理能力。然而,现有后训练方法在海量token上进行优化,隐含地假设有效学习必须依赖大量token。我们在同策略蒸馏(OPD)设置中重新审视这一假设,该设置天然允许在每个生成token上提供密集的教师监督。基于Qwen3系列模型,我们发现一种反直觉现象:通过极小比例的生成token即可有效激励推理能力——每条推理轨迹中仅需一至两个token,相当于所有token的0.05%。令人惊讶的是,这种极稀疏的监督在大多数情况下能匹配甚至超越全token训练在提升推理能力上的表现,尽管训练目标中排除了绝大多数生成token。该现象在九种教师-学生配置中持续出现,涵盖不同模型规模的数学推理任务,并在编码推理、Llama模型以及基于可验证奖励的策略优化(RLVR)中得到进一步验证。有趣的是,这种极稀疏的监督可能更贴近自然学习过程:并非逐词纠正每一步,而是聚焦关键推理步骤进行反思,更新先验理解,持续试错,避免微观级修正,却仍能取得显著效果。总体而言,我们的结果挑战了有效后训练必须依赖大量token的假设,并指明了更高效后训练算法设计的新方向。

极稀疏监督激励推理能力:论文配图
图 1:稀疏 OPD 的机制和有效性说明。左:稀疏 OPD 仅监督每个响应轨迹的一个标记。右:Qwen3-8B(学生)←\leftarrow Qwen3-4B-Instruct-2507(教师)的 AIME 2025 结果,比较基础学生、教师、普通 OPD 和三个稀疏 OPD 变体:maxtok、mintok 和 rand1tok。 maxtok 和 mintok 分别选择具有最大正向和负向奖励的Token,而 rand1tok 则为每个轨迹随机选择一个Token。阴影区域表示 95% 置信区间。值得注意的是,maxtok 培养的学生表现优于普通 OPD 和教师,mintok 与普通 OPD 相匹配,甚至 rand1tok 也比基础学生有大幅提高。所有三种稀疏 OPD 变体每个轨迹仅使用一个标记。