论文

A2D:以自回归后训练权重增强扩散语言模型

Enhancing Diffusion Language Models with Autoregressive Post-Training Weights

模型优化模型合并

摘要

扩散语言模型(dLLM)提供灵活词元更新顺序和并行解码,常在转换为扩散前以预训练自回归(AR)模型初始化,继承其表征。然而转换后通常忽略AR祖先丰富的后训练资源。我们发现这些已有AR后训练权重更新可回收以增强扩散模型:即使经过AR到扩散转换,直接加上AR后训练更新仍有效,表现接近直接扩散后训练。AR与扩散更新在权重空间近乎正交,却在扩散模型中诱发更一致的表征变化;不同更新也具有互补性,组合权重可保留两者收益并进一步改善后训练扩散模型。据此提出免训练A2D框架,将AR后训练能力迁到扩散底座,并组合两类更新改善已后训练的扩散模型。在Dream、DreamReasoner、DiffuCoder、Dream-Coder、Nemotron-Labs-Diffusion、DiffusionGemma等模型上,SFT和RL更新均可靠改善指令遵循、数学与代码,无需新增训练或推理计算。

A2D:以自回归后训练权重增强扩散语言模型:论文原图
(a) 高性能解决方案位于 AR 和扩散端点之间。