论文
先回答,后推理:当承诺顺序会影响扩散语言模型的准确性时
Answer First, Reason Later: When Commitment Order Costs Accuracy in Diffusion Language Models
摘要
屏蔽扩散语言模型并行修改许多屏蔽输出位置。一旦词元变得可见并且不再被屏蔽,我们就调用已提交的词元,并在最终答案在其前面打印的推理之前提交时调用响应答案优先。在 1,069 个 GSM8K 测试问题上,明确的分步指令增加了无限制解码与仅允许在最左侧未解析位置附近进行承诺的解码器之间的准确性差异;无限制的解码还产生更多答案优先的轨迹。在 MATH-500 上,两个 LLaDA 模型将大部分短输出画布花在答案后提交的推理上,并且随着答案后写作的消失,边界门控的好处也会减少。 Dream-7B 很少有答案后写作,并且遵循不同的准确性模式。受控四选项任务在生成之前保留一个标记答案位置。在 LLaDA-8B、LLaDA-1.5 和 Dream-7B 上,延迟该位置的效果优于同等时间的推理词元延迟。 Dream 的原始差异最大,它在受控任务上的自由准确度较低。在保留位置接口下,答案的提交时间比普通的自由形式生成要早得多,这限制了干预结果的推广程度。承诺顺序影响用于完成响应的上下文以及有限输出画布的分配。