论文
双焦点扩散语言模型:并行生成的不对称双向上下文
Bifocal Diffusion Language Models: Asymmetric Bidirectional Context for Parallel Generation
摘要
离散扩散语言模型 (dLLM) 并行恢复屏蔽标记,比自回归 (AR) 生成提供显着的加速。然而,这种有前途的框架面临着一个基本的架构设计困境:\ding{182} 采用双向注意力通过允许每个位置访问完整上下文来实现强大的生成质量,但本质上与 KV 缓存不兼容,限制了批量服务场景中的推理吞吐量; \ding{183} 相反,因果注意力可以实现高效的缓存推理,但会丢失所有右侧上下文,从而大大降低生成质量。本文介绍了 Bifocal dLLM,这是一种通过 \emph{非对称双向上下文}解决这一困境的新范式。与双焦镜头类似,我们将范式实例化为 \textbf{R2LM} (从右到左 Mamba),它结合了两种互补机制:$a$)标准因果注意力提供精确的左上下文和完整的 KV 缓存兼容性,而 $b$)轻量级反向 Mamba SSM sidecar 提供压缩的右上下文而不破坏可缓存性。使用 60B 词元对 Qwen3-1.7B 进行持续预训练的全面实验表明,R2LM 通过 KV 缓存并行解码,在批量服务中实现了比双向 dLLM 高 2.4\times$ 到 $12.9\times$ 的吞吐量,并且比 AR 基线提高了 1.9\times$ 到 $2.9\times$ 的速度,同时超过了大多数基准测试的因果基线并超越了双向 dLLM平均而言。