论文

PSD:通过并行 推测解码 推动扩散 LLM 的帕累托前沿

PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative Decoding

模型推理投机采样

摘要

Diffusion 大语言模型 (dLLM) 通过迭代地对掩码标记序列进行去噪来生成文本。尽管 dLLM 可以在每个步骤中并行预测所有屏蔽位置,但大量的去噪迭代仍然使推理成本高昂。通过在每个步骤中揭露多个标记,可以在空间上降低这一成本,或者通过将多个去噪步骤压缩为一个验证调用,在时间上降低这一成本。我们提出了并行 推测解码 (PSD),这是一个 无需训练 框架,可以共同改进沿两个轴的推理。使用单次前向传递的置信度分数,PSD 通过可配置的自适应揭露策略选择要揭露的位置,并构建多深度推测草案,而无需额外的模型调用。然后,最终的批量验证通过应用分层接受,保持最深的草稿与更新的预测保持一致。在推理和代码生成任务上对三个 dLLM 进行的实验表明,PSD 在推理效率和生成质量之间实现了有利的权衡,每次前向传递达到高达 5.5\times$ 的词元,其准确度与贪婪解码相当。