论文
FLARE:混合语言模型的扩散
FLARE: Diffusion for Hybrid Language Model
摘要
自回归 (AR) 大语言模型 (LLM) 已取得广泛的实际成功,但顺序解码仍然是低延迟部署的关键瓶颈。最近的高效推理工作沿着两个方向取得进展:通过高效架构降低每个模型调用的成本,并通过并行生成减少串行解码步骤。混合注意力主干解决了前者,而扩散语言模型(dLLM)则通过迭代并行去噪来追求后者。结合这些优势仍然具有挑战性:AR 到 dLLM 的转换通常无法保留种子检查点功能,而混合注意力循环状态和掩蔽约束使得扩散训练和服务变得非常重要。我们提出了 FLARE,一种用于混合注意力 LLM 的系统转换框架。我们的分析表明,传输数据质量是能力保留的主要决定因素,其重要性超过了损失公式和注意力掩模设计。由此产生的框架结合了词元等价的 AR 和扩散目标、硬件感知内核和统一推理,使一个检查点能够支持 AR 风格的验证解码和扩散风格的并行去噪。从具有有限 后训练 数据的强大 AR 检查点开始,FLARE 在各个模型规模上与领先的开源 dLLM 具有竞争力,并且在单 GPU 并发服务中比开源 dLLM 基线提供一致的吞吐量增益。我们的结果进一步表明,实用的 dLLM 不仅受到解码算法的限制,还受到传输数据质量和当前块扩散目标训练效率低下的限制,从而激发了数据、目标、架构和推理系统的联合设计。