论文
扭转潮流:用于扩散的跨架构 蒸馏 大语言模型
Turning the TIDE: Cross-Architecture Distillation for Diffusion Large Language Models
摘要
Diffusion 大语言模型 (dLLM) 提供并行解码和双向上下文,但最先进的 dLLM 需要数十亿个参数才能获得竞争性能。虽然 dLLM 的现有 蒸馏 方法减少了单个架构内的推理步骤,但没有一个解决跨架构知识转移,其中教师和学生在架构、注意力机制和分词器方面存在差异。我们提出了 TIDE,这是跨架构 dLLM 蒸馏 的第一个框架,由三个模块化组件组成:(1)TIDAL,它在训练进度和扩散时间步长之间联合调制 蒸馏 强度,以考虑教师的噪声相关可靠性; (2) CompDemo,通过互补掩模分割来丰富教师的上下文,以改进重掩模下的预测; (3) 反向 CALM,一种交叉分词器目标,可反转块级似然匹配,产生有界梯度和双端噪声过滤。通过两个异构管道将 8B 密集型和 16B MoE 教师提炼为 0.6B 学生,在八个基准测试中平均优于基线 1.53 分,在代码生成方面产生显着收益,其中 HumanEval 分数达到 48.78,而 AR 基线为 32.3。