论文

以正确的规模思考:在训练后的 LLM 上摊销 蒸馏

Thinking at the Right Size: Amortized Distillation Across Post-Trained LLMs

摘要

大语言模型 (LLM) 的实际部署需要一系列经过训练的变体——指令调整、推理调整和聊天式模型——每个模型都有多种尺寸,以满足不同的延迟和内存预算。独立生成每个(变体,大小)对是令人望而却步的,因此模型系列通常只跨越每个训练后变体的少数粗粒度大小。 Boomerang 蒸馏(Kangaslahti 等人,2026)沿基本模型的尺寸轴降低了这一成本。通过模型大小插值,它可以从单个师生对构建中间大小的模型,而无需额外训练。然而,它仍然将每个训练后的变体视为单独的优化对象。我们引入了 ADAPT---Amortized 蒸馏 Across Post-Trained LLM---一个框架,用于在模型系列的两个轴上摊销 蒸馏:尺寸和 后训练 变体,使用单个 蒸馏 生成 $L \times K$ 模型,用于跨 $K$ 训练后变体的 $L$ 插值尺寸跑。 ADAPT 结合了两个组件。首先,两阶段的 蒸馏 程序通过 预训练 对齐和监督的 微调 蒸馏 构建经过训练的学生,从而在生成和推理任务上实现平滑的大小-性能插值。其次,权重增量初始化通过将 蒸馏 引起的权重变化从基础模型转移到从不同的训练后变体初始化的学生来近似跨训练后变体的这种构造。由此产生的插值模型连续体还可以在推理时进行自适应模型大小选择,从而改善长形式推理任务的计算与准确性权衡。