论文

DreamReasoner-8B:扩散推理模型的块级课程学习

DreamReasoner-8B: Block-Size Curriculum Learning for Diffusion Reasoning Models

模型训练合成数据

摘要

块扩散语言模型通过并行分块去噪加速解码,但它们是否能够可靠地扩展以进行长链思维(CoT)推理仍然悬而未决。为此,我们开发了开源块扩散推理模型DreamReasoner-8B,并对训练和推理块大小如何影响长CoT推理进行系统研究。我们的分析揭示了明显的性能差异:使用大块大小进行训练会产生非常差的推理,而小块大小则保持有效的推理。为了弥补这种粒度差距,我们提出了块大小课程学习,逐渐将训练从细粒度的块大小过渡到粗粒度的块大小,从而克服了这一限制,并实现了强大的推理性能,可以泛化到不同的推理块大小。在数学和代码推理基准测试中,DreamReasoner-8B 取得的结果可与 Qwen3-8B 等领先的开放自回归模型相媲美。这项工作为高效、具有推理能力的扩散语言模型奠定了实践基础。我们在 https://github.com/DreamLM/DreamReasoner 发布了我们的模型。