当困惑出现时:以生成为中心的混合序列模型 蒸馏
When Perplexity Lies: Generation-Focused Distillation of Hybrid Sequence Models
摘要
通过 蒸馏 将预训练的 Transformer 转换为更高效的混合模型,为降低推理成本提供了一种有前景的方法。然而,要在蒸馏模型中实现高质量生成,需要对学生架构和 蒸馏 流程进行仔细的联合设计。许多先前的 蒸馏 作品通过使用对数似然对候选答案进行排名来评估下游多项选择基准,而不是需要自回归生成,这可能会掩盖模型质量的重要差异。例如,在重叠基准上,我们表明,在对数似然评分下,7B 蒸馏模型与教师的匹配度几乎在 0.2 pp 以内,而当它必须自回归生成答案时,它落后了 20.8 pp。我们使用 GenDistill 来研究这一现象,GenDistill 是我们设计的一个多级管道,用于将预训练的 Transformer 提炼成高效的 Hybrid Kimi Delta Attention (Hybrid-KDA) 学生。使用它作为 Qwen3-0.6B 上的受控测试平台,我们系统地消除了六个设计轴(训练目标、损失掩蔽、训练持续时间、数据集选择、参数冻结和架构选择),并在对数似然和基于生成的协议下评估每个选择。我们发现基于对数似然的评估始终低估教师和学生之间的差距,并且在某些情况下可能会逆转设计选择的排名,因此仅从困惑度评估中得出的结论可能会产生误导。在我们研究的因素中,数据集选择、仅完成屏蔽和 后训练 期间冻结注意力层对生成质量的影响最大。我们最好的 蒸馏 配方,使用混合 KDA 模型作为学生,在知识基准上保留了 86-90% 的教师准确性,同时将 KV 缓存内存减少了 75%,并将 128K 词元上下文中的首次词元时间缩短了 2-4 倍。