论文

打破分词器障碍:跨模型系列的 同策略 蒸馏

Breaking the Tokenizer Barrier: On-Policy Distillation across Model Families

摘要

同策略 蒸馏 (OPD) 已成为 大语言模型 (LLM) 的 后训练 中的核心技术,用于将知识从领域专家转移到学生模型。然而,现有的 OPD 蒸馏 方法要求教师和学生模型共享相同的分词器,限制了 OPD 在模型系列中的适用性。当前的主流实践通常对交叉分词器 蒸馏 的教师生成响应采用监督 微调 (SFT),这无法捕获教师概率分布中嵌入的丰富知识。在这项工作中,我们使标准 同策略 蒸馏 方法能够跨模型系列运行,确保高保真 词元级 信号可以通过精确的标记映射算法在不同的标记器之间传播。大量实验表明,跨分词器 OPD 的计算效率明显高于各种基准测试的基线。我们的结果为 OPD 解锁了更广泛的师生对,为适应和增强 LLM 之间的互动开辟了新途径。