论文
如何微调推理模型?合成学生一致的 SFT 数据的师生合作框架
How to Fine-Tune a Reasoning Model? A Teacher-Student Cooperation Framework to Synthesize Student-Consistent SFT Data
摘要
广泛采用的模型增强策略是使用由更强的模型生成的合成数据来进行监督 微调 (SFT)。然而,对于Qwen3-8B这样的新兴推理模型,这种方法往往无法提高推理能力,甚至会导致性能大幅下降。在这项工作中,我们发现教师生成的数据和学生的分布之间存在显着的风格差异,这是影响 SFT 的主要因素。为了弥补这一差距,我们提出了师生合作数据合成框架(TESSY),该框架将教师和学生模型交错,交替生成风格和非风格标记。因此,TESSY 生成的合成序列继承了教师的高级推理能力,同时保持与学生分布的风格一致性。在使用 GPT-OSS-120B 作为教师的代码生成实验中,教师生成的数据上的 微调 Qwen3-8B 导致 LiveCodeBench-Pro 上的性能下降 3.25%,在 OJBench 上下降 10.02%,而 TESSY 则实现了 11.25% 和 6.68% 的改进。