论文

FastGuide:加速扩散大语言模型的奖励指导

FastGuide: Accelerating Reward Guidance for Diffusion Large Language Models

模型推理推理加速

摘要

基于梯度的奖励指导提供了一种灵活的方法,可以使用下游奖励模型在推理时控制屏蔽扩散语言模型。然而,其计算成本仍然很高,因为每次解码迭代都会产生昂贵的扩散模型前向传递和奖励模型反向传播步骤。为了解决这个问题,我们引入了 FastGuide,这是一种并行和自回归解码的自适应混合体,可加速扩散语言模型的奖励指导。与并行解码类似,FastGuide 通过每个解码步骤计算一次指导并重用它来生成多个词元来摊销奖励模型反向传播的成本。在每个解码步骤中,FastGuide 通过一次揭开一个标记来使扩散前向传递自回归,同时利用 KV 缓存技术和注意力的稀疏重新计算在每次揭开后有效地重新计算标记分布。最后,为了使混合解码适应模型的置信度,FastGuide 推迟了模型在其重新计算的分布下不自信的任何标记。对三个奖励基准的实验表明,FastGuide 比顺序奖励引导解码快 4.4 美元\倍$,同时保持相似的生成质量。