论文

Ripple-Pivot 搜索:扩散的主动并行解码 大语言模型

Ripple-Pivot Search: Active Parallel Decoding for Diffusion Large Language Models

模型推理推理加速

摘要

扩散 大语言模型 (dLLM) 已成为自回归语言模型的竞争替代品,通过并行解码提供了大幅加快推理速度的潜力。现有的并行解码调度器通常仅在满足每个位置标准后才提交位置,而忽略了早期提交如何有利于后续解码。我们发现 dLLM 解码中的连锁反应:主动提交中熵枢轴位置可以导致剩余屏蔽位置的不确定性显着减少。这种不确定性的减少允许后续步骤并行揭露更多词元,从而加速整个解码过程。为了利用连锁反应,我们提出了 Ripple-Pivot Search (RPS),这是一种新颖的 无需训练 解码方法,该方法寻找中间熵位置作为有希望的候选枢轴(在哪里解码),并通过前瞻评估确定其词元分配,从而产生最大的下游收益(解码什么)。在 3 个 dLLM 和 4 个推理和代码生成基准测试中,RPS 比标准解码器实现了 4-10$\times$ 挂钟加速,同时保持了生成质量,并且比之前的前瞻基线提高了高达 5.49% 的准确性,同时在大多数设置中提供了更高的吞吐量。当与 KV 缓存集成时,RPS 比标准解码器进一步实现高达 18$\times$ 的挂钟加速。