论文
SimSD:扩散语言模型的简单推测解码
SimSD: Simple Speculative Decoding in Diffusion Language Models
摘要
扩散大语言模型通过并行或分块解码加快推理,但其掩码语言建模方式与标准词元级推测解码不兼容。自回归解码的因果掩码保持时间上有效的词元上下文,使目标模型能在一次前向计算中验证多个草稿词元;扩散模型使用掩码词元和双向注意力,有效上下文随去噪步骤改变,无法直接进行这种验证。SimSD提出简单的推测解码算法,主要利用即插即用的掩码策略建立时间上有效的词元上下文。方法显式加入草稿模型预测的参考词元,并设计注意力掩码控制它们与当前步骤词元的交互,让扩散模型一次前向计算即可为草稿词元计算有效logits。这恢复了自回归模型因果掩码提供的验证能力,同时保留扩散模型的并行解码优势。方法无需训练,可与KV缓存、分块解码等技术结合。SDAR系列模型在四项基准上的实验显示,解码吞吐最高提高7.46倍,平均生成质量得到保持乃至改善。