论文
自适应块扩散:解决扩散语言模型中的训练推理不匹配问题
Adaptive Block Diffusion: Resolving Training-Inference Mismatch in Diffusion Language Models
摘要
扩散语言模型(DLM)通常在固定的上下文结构下进行训练,将去噪限制在预定的标记子集中。这会造成训练和推理之间的不匹配,模型必须在任意配置上运行,从而导致训练网格的退化。我们提出了自适应块扩散(ABD),它通过优化前缀窗口配置分布上的去噪风险来解决这种不匹配问题。通过将配置视为随机变量,ABD 在整个配置空间上训练单个模型,而无需更改架构。我们表明,跨解码策略的泛化受到训练分布的支持的控制,并且 ABD 保证了训练期间覆盖其配置的任何推理策略的去噪最优性。根据经验,ABD 在解码尺度上表现出结构不变性,避免离网崩溃并恢复块大小和困惑度之间的单调关系,同时在目标尺度上匹配或优于固定块专家。