论文
支持快速扩散语言模型解码的词元显示
Supportive Token Revealing for Fast Diffusion Language Model Decoding
摘要
离散扩散语言模型可以通过并行更新多个掩码位置来有效地生成文本,但这种并行性引入了质量与延迟的权衡。激进的解码可能会过早地提交相互依赖的词元,而保守的解码则需要许多去噪步骤。现有方法通过使用置信度或依赖性标准来确定哪些词元可以安全地揭示来解决这种紧张关系。然而,避免不安全的提交并不一定会使剩余的屏蔽序列易于解码,因为不确定的词元可能依赖于屏蔽的词元,从而为去噪步骤造成瓶颈。我们提出了 AXON,这是一个 无需训练 模块,可以添加到扩散语言模型的现有并行解码策略之上。 AXON 不是更换基本解码器,而是监视剩余的不确定屏蔽词元,并仅在其当前状态表明需要额外上下文时进行干预。然后,它将标准从最安全的标记揭示到最有信心的揭示最能支持以后的去噪。 AXON 使用注意力、不确定性和置信度信号来选择锚点、不确定位置所关注的置信屏蔽标记。跨多个扩散语言模型的推理和代码生成基准实验表明,AXON 改善了现有并行解码器的质量与延迟权衡,通常可以减少函数评估的数量,同时保持或提高准确性。