论文

dQwen3.5:混合注意力扩散语言模型

dQwen3.5: Hybrid-Attention Diffusion Language Models

模型训练预训练

摘要

采用预训练的自回归 (AR) 模型是实现扩散语言模型 (DLM) 的一种经济高效的途径。虽然几乎所有此类适应都是从全注意力Transformer开始,但 AR 建模已转向将注意力层和 RNN 层交错的混合架构。这给适应带来了障碍:与注意力不同,RNN 在结构上是因果关系,并且对于双向化来说并不平凡。尽管存在这种不匹配,我们还是通过在 0.8B、2B、4B 和 9B 尺度上调整 Qwen3.5,研究这些主干是否可以成为有效的 DLM,从而产生 dQwen3.5 系列。我们发现混合骨干网可以成为适应的有效起点:在完全注意力控制的情况下,混合骨干网以大约一半的词元达到给定的训练损失。在各个尺度上,dQwen3.5 类似于任意顺序解码行为中的全注意力 DLM,并且在并行解码下表现强劲。