论文

Nemotron-Labs-TwoTower:具有预训练自回归上下文的扩散语言建模

Nemotron-Labs-TwoTower: Diffusion Language Modeling with Pretrained Autoregressive Context

模型架构混合架构

摘要

由于其并行和迭代生成的潜力,扩散语言模型为自回归模型提供了一种有前景的替代方案。然而,现有方法使用单个网络进行上下文表示和迭代去噪,迫使一个模型同时服务于这两个角色,并限制了其扮演任一角色的能力。我们提出了 TwoTower,一种块式自回归扩散模型,它将这些角色解耦成两个塔:一个是因果处理干净词元的冻结 AR 上下文塔,另一个是具有双向块注意力的可训练扩散降噪器塔,通过对上下文的交叉注意力来细化噪声块。 Nemotron-Labs-TwoTower 基于开放权重 30B 混合 Mamba-Transformer MoE 模型 Nemotron-3-Nano-30B-A3B 构建,并在大约 2.1T 词元上进行训练,保留了 98.7% 的自回归基线质量,同时提供高出 2.42 倍的挂钟生成吞吐量。我们在 https://huggingface.co/collections/nvidia/nemotron-labs-twotower 上发布了代码和模型权重。