论文

SimpleOPD:用于长上下文推理的简单分词器无关的 同策略 蒸馏

SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning

摘要

同策略 蒸馏 (OPD) 提供了一种从更强的教师模型转移推理能力的有前途的方法,但将其应用于长上下文推理教师和短上下文学生会带来实际挑战,包括分词器不匹配、师生分布不匹配、响应长度爆炸和训练不稳定。在这项工作中,我们通过将证明推理能力从长上下文推理模型 SU-01 转移到短上下文学生模型来研究这种设置。为了处理标记器差异,我们在共享文本空间中执行 OPD,并仅对齐在学生和教师标记器下占据相同文本范围的标记。为了缓解生成长度过长和频繁截断的问题,我们引入了学生参考 KL 损失,并掩盖了 </think> 和 <|im_end|> 等特殊终止标记的优点。这种策略限制学生过度偏离最初的政策,从而缓解师生分布不匹配问题并促进长度的稳定增长。对同家庭和不同家庭学生模型(包括 Qwen3、Qwen3.5、Intern-S2、GLM-4.7、Gemma-4)的实验表明,在数学推理(尤其是自然语言数学证明)方面取得了一致的进展。值得注意的是,Intern-S2-Preview 在 ProofBench 上提高了 21.2 分,达到 55.2,超过了 Gemini-2.5-Pro。它还改进了 HLE 和 HiPhO 等科学基准,表明 OPD 转移的推理能力可以推广到数学训练领域之外。