论文

Zarya:一种具有灵活训练和双模式推理的混合自回归-掩模扩散语言模型

Zarya: A Hybrid Autoregressive--Masked Diffusion Language Model with Flexible Training and Dual-Mode Inference

模型架构新型架构

摘要

自回归语言模型 (ARM) 受到顺序、从左到右生成的限制,而掩码扩散模型 (MDM) 可以实现并行解码,但由于无法重用键值 (KV) 缓存以及学习对难以处理的词元组合空间的依赖性而产生不连贯的生成,因此计算开销较高。我们引入了 Zarya,这是一系列混合语言模型,可在单一架构中联合优化自回归 (AR) 目标和掩模扩散目标。 Zarya 将训练数据构建为可变大小的槽,并采用逐渐增加槽粒度的课程,实现从细粒度 AR 学习到粗粒度扩散学习的平滑过渡。在推理方面,Zarya 通过统一的接口提供了两种不同的解码范例:(i)具有首次命中去噪的 MDM 采样,以及(ii)时隙推测解码,将基于时隙间扩散的选择与时隙内自回归填充交织在一起,实现完全的 KV 缓存重用。训练和推理机制完全解耦,允许使用任何配置训练的模型在任一模式下部署。广泛的可配置性——包括分组噪声模式(前缀完成、填充前缀、填充中间)、有序采样计划和噪声水平排列策略——支持灵活的研究探索。我们公开发布了 0.6B、1.7B 和 4B 尺寸的 Zarya 模型,展示了标准基准的性能,同时提供自回归和扩散范式的原则性集成。