论文

通过专家积桥的扩散语言模型并行解码

Diffusion Language Model Parallel Decoding via Product-of-Experts Bridge

模型推理投机采样

摘要

扩散语言模型 (DLM) 通过并行解码提供了显着的速度优势,但与自回归 (AR) 模型相比,缺乏词元依赖性限制了生成质量。最近的进展试图通过重要性采样来弥合差距,其中 DLM 是提案,AR 是目标。然而,由于它们的分布之间存在巨大差距,采样需要大量粒子,因此计算成本昂贵。在本文中,我们介绍了 PoE-Bridge,这是一种新颖的解码框架,通过引入中间分布来弥合差距,从而大大提高了生成速度和准确性。该分布被构建为 DLM 提案和 AR 目标的专家产品 (PoE)。对于中间分布,我们首先使用 DLM 并行起草多个延续,然后应用拒绝采样来验证起草的词元并将生成的候选者移向 PoE。然后,我们使用重要性采样来进一步纠正 PoE 对齐的候选对象以实现 AR 目标。我们进一步提出了几种改进的技术,包括用于增强多样性的混合温度采样和用于减少浪费验证的弹性拒绝窗口。根据经验,PoE-Bridge 的准确性显着提高,比标准 DLM 解码方法加速了 5 倍,并恢复了至少 95% 的目标 AR 模型性能,有效弥补了具有挑战性的数学推理和编码任务的大部分质量差距。我们的代码可在 https://github.com/juntongshi48/poe-bridge 获取。