论文
早鸟解码:利用可学习的块大小和并行采样加速扩散 LLM
Early-Bird Decoding: Accelerating Diffusion LLMs with Learnable Block Sizes and Parallel Sampling
摘要
扩散大语言模型 (dLLM) 提供了一种有前途的并行解码范例,作为通过迭代揭露的自回归生成的替代方案。然而,dLLM 在词元置信度达到解码阈值之前通常需要许多步骤,即使使用逐块 KV 缓存,也会导致推理效率低下。为了加速 dLLM 推理,我们首次提出了一种“早鸟(EB)”解码框架,其动机是观察到具有类似低熵的词元倾向于聚类,并且可以在达到置信度阈值之前更早地联合解码。特别是,我们的 EB-Decode 框架集成了两个关键推动因素:(1) 一个可学习的网络,可以将具有类似不确定性的词元自适应地分组为可变长度的块,而不是依赖于固定的块大小; (2) 位置感知采样器,它学习在预测的可变长度块内使用更少的解码步骤并行地揭开标记。这两个组件都是在不修改预训练的 dLLM 权重的情况下开发的,因此可以在服务期间直接部署为插件,训练和推理开销可以忽略不计。跨三个模型和四个基准的大量实验一致验证了我们的观察和 EB-Decode 的有效性,与普通解码方法相比,吞吐量提高了 3.53-18.76$\times$,并且比最强基线 Fast-dLLM 的吞吐量提高了 1.58$\times$,且精度相当。