论文

基于块局部性的掩蔽扩散语言模型的可训练性

On the Trainability of Masked Diffusion Language Models via Blockwise Locality

模型架构新型架构

摘要

掩码扩散语言模型 (MDM) 最近已成为标准自回归 大语言模型 (AR-LLM) 的有前途的替代品,但其优化可能不太稳定。我们研究了块式 MDM,并将其与 AR-LLM 在三个强调结构化生成不同方面的受控任务上进行比较:上下文线性回归、图形路径查找和数独求解。我们发现标准随机屏蔽 MDM 无法可靠地学习线性回归,在图路径查找方面表现出高方差训练动态,同时在数独上优于 AR-LLM。为了减轻这些不稳定性,我们提出了两种局部性感知块模型,即 Jigsaw 和 Scatter,它们通过在块内强制自回归局部性来注入从左到右的归纳偏差,同时保留块级别的迭代细化。根据经验,Jigsaw 在线性回归方面与 AR-LLM 稳定性相匹配,并且在数独方面保持强劲,而 Scatter 在寻路方面保留了扩散的规划优势。我们的结果表明,标准随机掩蔽 MDM,即使具有块式变体,也可能是用于有序生成的扩散 LM 的次优实例,从而激发了超越随机掩蔽的模型。