论文

VoidPadding:让 [VOID] 处理掩码扩散语言模型中的填充,以便 [EOS] 可以专注于语义终止

VoidPadding: Let [VOID] Handle Padding in Masked Diffusion Language Models so that [EOS] Can Focus on Semantic Termination

模型推理解码与生成控制

摘要

MDLM 通过对预先分配的屏蔽响应画布进行去噪来生成文本,从而使响应长度建模成为指令调整的核心。现有的 MDLM 通常继承在指令调整期间使用重复的 \texttt{[EOS]} 标记进行填充的自回归约定,从而使 \texttt{[EOS]} 具有作为语义终止符和填充标记的双重角色。我们证明这种双重作用是大块解码下 \texttt{[EOS]} 溢出的根本原因。为了解耦这些角色,我们提出了 VoidPadding,它引入 \texttt{[VOID]} 用于填充,并保留 \texttt{[EOS]} 用于终止。在推理过程中,学习到的 \texttt{[EOS]} 信号可以提前停止,而学习到的 \texttt{[VOID]} 信号可以引导自适应响应画布扩展。在 Dream-7B-Instruct 上,VoidPadding 将数学推理和代码生成基准的块大小平均四任务平均值比原始模型提高了 \(+17.84\) 点,比 RainbowPadding 提高了 \(+6.95\) 点,同时平均将解码 NFE 降低了 55.7%。代码可在 https://github.com/Haru-LCY/VoidPadding 获取。