论文
LLM 中的桥梁花园困境 蒸馏:为什么混合硬标签和软标签有效
The Bridge-Garden Dilemma in LLM Distillation: Why Mixing Hard and Soft Labels Works
摘要
知识蒸馏 (KD) 将知识从大型教师模型转移到较小的学生。在语言建模中,学生接受从教师采样的标记(硬标签)或教师完整的下一个标记分布(软标签)的训练。尽管软标签看起来更加丰富,但我们发现混合硬标签和软标签始终会产生更好的结果。至关重要的是,我们表明这种增益不能通过训练期间更密切的教师匹配来解释。相反,它来自于暴露偏差的减少,即训练和推理分布之间的不匹配。为了解释这种现象,我们引入了桥-花园分解理论,该理论将生成步骤分为两种类型:桥,其中下一个标记必须是精确的,以及花园,其中它可以是灵活的。我们表明,纯硬 KD 通过避免风险偏差在桥梁中表现出色,而纯软 KD 则保留了花园中的多样性。混合策略可以处理这两种情况,从而减少整个序列的曝光偏差。在这一理论的指导下,我们开发了一系列 Bridge-Garden 混合监督方法,可以自适应地平衡硬标签和软标签。在由七个师生对(包括 Qwen、Llama、Gemma 和 DeepSeek)组成的主要套件以及推理和编码基准中,我们的方法优于基于散度和 同策略 KD 基线,同时将训练成本降低了 9.7 倍,从而实现了高效的模型压缩。代码可在 https://github.com/ghwang-s/bridge_garden_hybrid_kd_release 获取。