论文

教扩散从左到右进行推测

Teaching Diffusion to Speculate Left-to-Right

模型推理投机采样

摘要

大语言模型 (LLM) 在广泛的任务中实现了卓越的性能,但由于固有的顺序词元生成,它们的自回归解码过程会产生大量的推理成本。 推测解码 通过采用轻量级草稿模型来提出多个未来词元,随后由更大的目标模型并行验证,从而解决了这一瓶颈。最近的工作表明,扩散语言模型非常适合这种设置,因为它们可以并行生成整个草案标记块,从而减轻自回归起草的顺序约束。这种机制的微妙之处在于,区块扩散起草者在区块内双向生成词元,而验证是通过自回归目标模型执行的,该模型以严格从左到右的方式评估词元,从而在对称训练时间目标和不对称验证时间奖励之间留下了差距。在这项工作中,我们对缩小这一差距的三种训练时间干预措施进行了实证分析:词元位置加权、针对打破每个块内接受的前缀的位置的一阶错误焦点损失,以及用可微分替代项代替预期接受长度的链损失项。这三种干预措施沿着正交轴(位置、块条件第一误差、关节前缀)作用并相加;它们同样与多选秀自选等测试时调整机制正交,原则上它们可以结合起来。在四个目标模型和六个推理、代码和对话基准中,这三种干预措施将每个基准的可接受草稿长度比位置统一基线提高了 21-76%,而无需添加额外的前向传递,也无需更改推理管道或拒绝采样准确性契约。