论文

克服 LLM 推理的策略自蒸馏的扩展限制

Overcoming Scaling Limits in On-Policy Self-Distillation for LLM Reasoning

摘要

on-policy自蒸馏 (OPSD) 训练学生沿着其自己的采样轨迹匹配特权教师分布。标准 OPSD 将这种监督应用于未经验证的学生展示,同时根据特权上下文(通常是参考解决方案)对教师进行调节。我们在因子分析中将这些角色分开,发现支架正确性对下游准确性的影响比上下文正确性更强。未经验证的支架会造成模仿差距,因为教师可以使用学生无法获得的信息。这种差距随着模型规模的扩大而缩小,但 OPSD 继续监督大多数未经验证的轨迹。相比之下,即使教师以学生自己不成功的部署为条件,经过验证的支架仍然有效。基于这一发现,我们引入了 OASIS,它保留了 OPSD 目标,但主要通过标签政策轨迹进行监督,并用未经验证的模型生成的尝试替换书面解决方案作为教师上下文。因此,OASIS 仅需要最终答案标签。在 AIME 2024、AIME 2025 和 HMMT 2025 上的 Qwen3-1.7B、4B 和 8B 中,OASIS 比基本模型平均提高了 3.2--3.8 点,而 OPSD 的增益从 1.7B 时的 3.05 点下降到 8B 时的 0.14 点。在 8B 时,OASIS 比 OPSD 提高了 3.05 个点,这表明经过验证的策略支架在模型规模扩展时保留了自蒸馏的有效性。