论文
极稀疏监督激励推理能力
Extremely Sparse Supervision Incentivizes Reasoning Ability
摘要
大语言模型通过有效的后训练展现出日益强大的推理能力。然而,现有后训练方法在海量token上进行优化,隐含地假设有效学习必须依赖大量token。我们在同策略蒸馏(OPD)设置中重新审视这一假设,该设置天然允许在每个生成token上提供密集的教师监督。基于Qwen3系列模型,我们发现一种反直觉现象:通过极小比例的生成token即可有效激励推理能力——每条推理轨迹中仅需一至两个token,相当于所有token的0.05%。令人惊讶的是,这种极稀疏的监督在大多数情况下能匹配甚至超越全token训练在提升推理能力上的表现,尽管训练目标中排除了绝大多数生成token。该现象在九种教师-学生配置中持续出现,涵盖不同模型规模的数学推理任务,并在编码推理、Llama模型以及基于可验证奖励的策略优化(RLVR)中得到进一步验证。有趣的是,这种极稀疏的监督可能更贴近自然学习过程:并非逐词纠正每一步,而是聚焦关键推理步骤进行反思,更新先验理解,持续试错,避免微观级修正,却仍能取得显著效果。总体而言,我们的结果挑战了有效后训练必须依赖大量token的假设,并指明了更高效后训练算法设计的新方向。
