论文

SODA:半 同策略 黑盒 蒸馏 适用于 大语言模型

SODA: Semi On-Policy Black-Box Distillation for Large Language Models

摘要

大语言模型 的黑盒 知识蒸馏 提出了严格的权衡。简单的 离策略 方法(例如序列级 知识蒸馏)很难纠正学生的固有错误。完全 同策略 方法(例如,生成对抗 蒸馏)通过对抗训练解决了这个问题,但引入了众所周知的训练不稳定和严重的计算开销。为了解决这一困境,我们提出了 SODA(Semi 同策略 蒸馏 with Alignment),这是一种高效的替代方案,其动机是前沿教师和更小的基础模型之间固有的能力差距。由于紧凑的学生模型的自然、零样本响应几乎完全低于强大的教师目标,因此我们只需将教师的最佳响应与学生输出的一次性静态快照配对即可构建高效的对比信号。这表明,让小学生暴露于其自身的静态劣势行为足以实现高质量的分布调整,从而消除了昂贵的动态轨迹采样和脆弱的对抗性平衡的需要。对四个紧凑型 Qwen2.5 和 Llama-3 模型的广泛评估验证了这种半 同策略 范例。 SODA 在 16 个基准测试结果中有 15 个与最先进的方法相匹配或优于最先进的方法。更重要的是,它实现了卓越的 蒸馏 质量,同时训练速度提高了 10 倍,消耗的峰值 GPU 内存减少了 27%,并完全消除了对抗性不稳定。