论文
极其简单的 Self-蒸馏 改进了代码生成
Embarrassingly Simple Self-Distillation Improves Code Generation
摘要
大语言模型 (LLM) 能否仅使用其自己的原始输出来改进代码生成,而无需验证器、教师模型或强化学习?我们用简单的自我 蒸馏 (SSD) 给出肯定的答案:从具有特定温度和截断配置的模型中采样解决方案,然后使用标准监督 微调 对这些样本进行微调。 SSD 将 Qwen3-30B-Instruct 在 LiveCodeBench v6 上的 pass@1 从 42.4% 提高到 55.3%,收益主要集中在更难的问题上,并且它在 4B、8B 和 30B 规模上泛化了 Qwen 和 Llama 模型,包括指令和思维变体。为了理解为什么这样一个简单的方法可以发挥作用,我们将这些收益追溯到 LLM 解码中的精度探索冲突,并表明 SSD 以上下文相关的方式重塑词元分布,在精度很重要的情况下抑制干扰尾部,同时在探索很重要的情况下保留有用的多样性。总而言之,SSD 提供了一个互补的 后训练 方向来改进 LLM 代码生成。我们的代码位于 https://github.com/apple/ml-ssd