论文
有针对性的重新掩码:用离散扩散语言模型中的词元到掩码细化代替词元编辑
Targeted Remasking: Replacing Token Editing with Token-to-Mask Refinement in Discrete Diffusion Language Models
摘要
离散掩码扩散语言模型(例如 LLaDA)通过迭代去噪生成文本,其中掩码标记逐渐被预测标记替换。 LLaDA2.1引入了Token-to-Token(T2T)编辑机制,通过直接替换疑似不正确的已提交Token来加速生成。然而,我们发现了 T2T 编辑的基本局限性:它将错误检测与替换结合起来,用潜在不正确的标记污染生成上下文,并引入训练推理噪声不匹配,其中系统模型生成的错误与训练期间看到的随机扰动不同。我们提出 Token-to-Mask (T2M) 重新屏蔽,这是一种 无需训练,T2T 编辑的直接替代品,可将可疑的错误词元重置回屏蔽状态,从而允许扩散过程在更清晰的上下文中重新预测它们。我们设计并实证验证了三种互补的错误检测策略——基于概率、触发镜像和基于时间差——并提供了统一的理论分析,表明 T2M 重新掩码净化了生成上下文,将系统推理错误转换回模型的本地掩码噪声类型,并实现了联合多位置优化的延迟承诺。涵盖知识、推理、数学、编码和指令跟踪等 12 个基准的综合实验表明,T2M 通常可以提高需要精确 词元级 输出的任务的性能,其中数学方面的增益最大(CMATH 上 +5.92%)。 CMATH 上的错误分析表明,主要的故障模式是最后一英里词元损坏——正确的推理会产生损坏的最终答案——而 T2M 修复了 59.4% 的此类案例。