论文

扩散语言模型中标记编辑的自生成错误训练

Self-Generated Error Training for Token Editing in Diffusion Language Models

模型训练合成数据

摘要

词元到词元 (T2T) 编辑让 LLaDA2.1 在块扩散解码期间修改提交的词元。发布的配方对编辑器进行随机词汇损坏的训练,但在推理时,编辑器看到的是模型自己流畅的、高置信度的草稿错误。我们研究了这种训练-推理不匹配,并提出了自生成的 T2T,它执行无梯度草稿传递,用预测的标记填充屏蔽位置,并在这些自生成的损坏下监督第二遍的恢复。我们将更新作为 LLaDA2.1-mini 上的简短 LoRA 持续预训练传递来实现,并在官方 Q-Mode T2T 程序下在推理参数不变的情况下对多个基准进行评估。该方法通常可以提高准确性,同时降低 T2T 编辑强度,减轻故障模式,例如正确推理后的最终数字转录错误以及简短事实答案之前的过度自我纠正。