论文
内省式扩散语言模型
Introspective Diffusion Language Models
摘要
扩散语言模型有望实现并行生成,但在质量上仍落后于自回归(AR)模型。我们将这一差距归结为内省一致性(introspective consistency)的缺失:AR模型会认同自己生成的内容,而扩散语言模型(DLM)往往不会。我们定义了内省接受率,用于衡量模型是否接受其先前生成的词元。这揭示了AR训练为何具有结构性优势:因果掩码与logit偏移隐式地强制执行了内省一致性。受这一观察启发,我们提出内省式扩散语言模型(I-DLM),这一范式在保留扩散式并行解码的同时继承了AR训练的内省一致性。I-DLM采用新颖的内省跨步解码(ISD)算法,使模型能在同一次前向传播中一边验证先前生成的词元,一边推进新词元的生成。从系统角度看,我们在继承自AR的优化之上构建I-DLM推理引擎,并通过固定批次调度器进一步定制。据我们所知,I-DLM是首个在质量上比肩同规模AR模型的DLM,并在15个基准上于模型质量与实际服务效率两方面均超越既有DLM。它在AIME-24上达到69.6,在LiveCodeBench-v6上达到45.7,分别超过LLaDA-2.1-mini(16B)26分和15分以上。除质量外,I-DLM还面向日益增长的大并发服务需求而设计,吞吐量约为先前最先进DLM的3倍。
