论文
PreDiff-LM:采用混合注意力的预训练离散掩码扩散语言建模
PreDiff-LM: Pretrained Discrete Masked Diffusion Language Modeling with Hybrid Attention
摘要
离散掩码扩散语言模型支持双向生成与填充,但适配预训练自回归(autoregressive,AR)transformer需要调和因果预训练与双向去噪。我们在注意力层面研究这一问题,而不主张AR权重复用本身具有新颖性。PreDiff-LM在观测到的提示内保留因果注意力,同时允许被掩码的目标内部使用完全双向注意力。在匹配的GPT-2 Medium、WikiText-103、90K步设置下,与使用相同AR初始化的均匀双向注意力相比,这种混合掩码将无条件困惑度从34.1降至28.7,MAUVE从0.71提升至0.78。注意力适配还能与DiffuGPT式的目标函数适配叠加,达到26.9的困惑度。预训练初始化将困惑度降到50以下所需的步数从约350K减少到8K,不过在同等规模、计算量匹配的条件下,微调后的AR模型仍更强(18.9对28.7)。除困惑度外,与既有扩散基线相比,PreDiff-LM还改善了重复问题、分布质量、四个零样本下游任务以及人类偏好。这些结果将混合注意力定位为适配预训练因果骨干的一种互补机制,同时明确了与优化AR模型之间尚存的质量与推理效率差距。
