论文
冻结塔保留生成:MoE LLM的低预算AR到扩散转换
Context-Tower Conversion Preserves Generation While Freezing Retains Knowledge: Low-Budget AR-to-Diffusion Conversion of MoE LLMs
摘要
把预训练自回归(AR)模型转换为扩散语言模型(dLLM)可在不预训练新模型的情况下实现并行生成。已发表转换方法的训练数据量相差约三个数量级,且从未在共同协议下比较。我们比较同一30B混合专家(MoE)母模型的两种转换:固定语料、监督token预算、可训练参数集与评估Harness,各自沿用其训练配方。原位(in-place)模型用去噪与表示对齐损失更新母模型的部分权重;冻结塔(frozen-tower)模型通过交叉注意力以母模型的冻结因果副本为条件。1B训练token下,冻结塔模型HumanEval pass@10为71.60,原位模型仅6.19(11.6倍);同预算下冻结塔保留母模型GSM8K的95%与MMLU-Pro的99%。稠密母模型实验复现了HumanEval的分离。在约500M token的双塔设计中,冻结上下文塔比训练它保留多得多的MMLU-Pro性能,两者HumanEval观测值相近。理论分析确立两类转换在硬注意力掩码与逐轮自左向右提交下都包含AR母模型的精确采样器;共享损失下冻结切断了经上下文状态的梯度贡献。此外评估协议会双向地实质影响一个已发表的500B token转换的分数(其AR母模型分数变化不足三点),因此比较dLLM需要共同协议。结果表明在受测低预算区间,冻结塔配置比原位转换保留更多母模型生成性能。