论文

DepCap:用于高效扩散 LM 推理的自适应分块并行解码

DepCap: Adaptive Block-Wise Parallel Decoding for Efficient Diffusion LM Inference

模型推理推理加速

摘要

扩散语言模型(DLM)因其并行解码和整个序列的全局细化的潜力而成为自回归语言生成的有前途的替代方案。为了释放这一潜力,DLM 推理必须仔细平衡生成质量和解码速度。最近的逐块 DLM 解码方法通过在块中顺序执行基于扩散的解码来改善这种权衡。然而,现有方法通常依赖于固定块调度或当前步本地信号来确定块边界,并使用保守的基于置信度的并行解码来避免冲突,从而限制了质量与速度的权衡。在本文中,我们认为逐块 DLM 推理需要更合适的信号来实现其两个核心决策:用于确定块边界的跨步信号和用于并行解码的 词元级 冲突信号。基于这个观点,我们提出了 DepCap,一个用于高效分块 DLM 推理的 无需训练 框架。具体来说,DepCap 将跨步信号实例化为最后一个解码块的影响,并使用它来自适应地确定下一个块应延伸多远,同时识别每个块内安全并行解码的无冲突词元子集,从而在质量下降可忽略不计的情况下实现显着的推理加速。 DepCap是一种适用于各种DLM的即插即用方法,并且与现有的块级DLM的KV缓存策略兼容。信息论分析进一步表明,最后一个块对候选块的累积影响在词元之间近似相加,支持了所提出的块划分标准。实验结果表明,DepCap 在多个 DLM 主干以及推理和编码基准上实现了有利的速度与质量权衡,加速高达 5.63$\times$,而性能没有显着下降。