推测性修正:扩散语言模型的先草后细的解码
Speculative Correction: Draft-then-Refine Decoding for Diffusion Language Models
摘要
扩散语言模型 (DLM) 可以双向修改标记,但标准解码程序通常通过逐块生成文本来使它们适应从左到右的生成。我们研究一种简单的即插即用推理模式:首先生成完整的草稿,然后使用双向扩散完善完整的响应。使用 LLaDA2.1-Flash 和 LLaDA2.1-Mini,我们评估了两种配置。在Flash-Flash中,同一个Flash模型既充当起草者又充当细化者,测试现有模型是否可以通过全局细化来改进其自身的块自回归输出。在 Mini-Flash 中,受 推测解码 的启发,我们引入了推测性修正:Mini 起草完整的响应,Flash 将其修改为可编辑的初始化。 Flash-Flash 将 GSM8K-384 精度从 0.848 提高到 0.899,同时运行速度比所选 Flash 块自回归基线快 1.20 倍,并将 MBPP-384 从 0.545 提高到 0.693。延迟窗口匹配的仅闪存控制表明,在对块自回归解码进行有针对性的调整后,这些增益仍然存在。因果消融表明,已完成的草稿提供了有用的初始化:完全屏蔽跨度的细化表现不佳,全面的全局细化在 GSM8K 上提供了明显的额外增益,而局部细化捕获了 MBPP 和 MATH 上的大部分增益。 Mini-Flash 提供了有用的质量延迟权衡,包括 MATH-384 性能为 0.294,而 Flash 为 0.300,同时运行速度提高了 2.17 倍。这些结果支持帕累托前沿解释,而不是异构级联一致匹配闪存质量的主张。总体而言,同模型草稿和细化提供了证据,表明双向细化是 DLM 的有用解码原语,而推测性校正则展示了快速生成 DLM 的 无需训练 途径。