论文

前瞻性离散扩散模型的学习中继表示

Learned Relay Representations for Forward-Thinking Discrete Diffusion Models

模型架构递归架构

摘要

当掩蔽扩散模型 (MDM) 通过迭代细化生成序列时,掩蔽位置上的丰富内部计算将被丢弃,迫使每个后续细化步骤重新计算作为模型表示形式存储的有价值的内部信息。为了避免去噪轮次之间的硬重置,我们提出了学习中继表示(Relay),这种方法允许 MDM 在去噪时通过显式学习如何传播潜在信息以有利于未来去噪步骤来进行前瞻性思考。 Relay 引入了可微分的每个词元通道,该通道在前向传递之间传递信息,并通过时间截断反向传播 (BPTT) 进行训练。我们证明该框架可以扩展到最先进的扩散语言模型(DLM),并且与块扩散和 KV 缓存等技术无缝兼容。我们首先对 Relay 中一项具有挑战性的基于数独的规划任务的设计选择进行了彻底的论证。然后,我们将 Relay 扩展到 Fast-dLLM v2,这是一种最先进的 DLM,其在编码任务上的性能优于标准监督微调,同时将推理延迟减少高达 32%。我们的实证结果表明,最先进的 DLM 可以经过显式训练,在解码步骤中转发潜在信息,从而推进性能延迟帕累托前沿。我们为所有实验提供代码。