论文

MDLMPE:掩码扩散语言模型的分布感知位置编码

MDLMPE: Distribution Aware Positional Encoding for Masked Diffusion Language Models

模型架构Transformer

摘要

掩码扩散语言模型 (MDLM) 支持并行生成和双向上下文建模,但其位置上下文与自回归 (AR) 模型有根本不同。 AR 解码公开连续的前缀,而 MDLM 去噪则生成显示和屏蔽词元的动态、非连续配置。传统的位置编码(例如 RoPE)捕获序列顺序和成对位移,但对这种不断发展的词元可用性结构仍然不敏感。为了解决这个限制,我们提出了 MDLMPE,一种专门为掩蔽扩散设计的位置编码。据我们所知,MDLMPE 是第一种使位置表示明确意识到变化的显示/屏蔽配置的方法。它将词元可用性表示为二进制序列,应用距离感知高斯加权,并通过余弦基投影结果模式以获得分布感知位置特征。这些特征被添加到词元嵌入中,并通过轻量级 MLP 映射到调制标准 RoPE 相位的角度偏移。 LLaDA 和 DREAM 上的大量实验表明,MDLMPE 在监督 微调、预训练、零样本评估和块扩散设置方面通常优于传统位置编码方法。进一步的消融表明,可用性状态、高斯局部性、频谱基础和嵌入注入的完整组合产生了最强的结果。这些结果将不断演变的词元可用性分布确立为掩码扩散语言模型的有用位置信号。