论文

内省式扩散语言模型

Introspective Diffusion Language Models

模型推理解码与生成控制

摘要

扩散语言模型有望实现并行生成,但在质量上仍落后于自回归(AR)模型。我们将这一差距归结为内省一致性(introspective consistency)的缺失:AR模型会认同自己生成的内容,而扩散语言模型(DLM)往往不会。我们定义了内省接受率,用于衡量模型是否接受其先前生成的词元。这揭示了AR训练为何具有结构性优势:因果掩码与logit偏移隐式地强制执行了内省一致性。受这一观察启发,我们提出内省式扩散语言模型(I-DLM),这一范式在保留扩散式并行解码的同时继承了AR训练的内省一致性。I-DLM采用新颖的内省跨步解码(ISD)算法,使模型能在同一次前向传播中一边验证先前生成的词元,一边推进新词元的生成。从系统角度看,我们在继承自AR的优化之上构建I-DLM推理引擎,并通过固定批次调度器进一步定制。据我们所知,I-DLM是首个在质量上比肩同规模AR模型的DLM,并在15个基准上于模型质量与实际服务效率两方面均超越既有DLM。它在AIME-24上达到69.6,在LiveCodeBench-v6上达到45.7,分别超过LLaDA-2.1-mini(16B)26分和15分以上。除质量外,I-DLM还面向日益增长的大并发服务需求而设计,吞吐量约为先前最先进DLM的3倍。

内省式扩散语言模型:论文配图
图 1:(a) 内省一致性:标准 DLM 生成其分布 qq 与模型自身的下一步预测 pp 不同的token; I-DLM 训练生成和内省以达成一致(p≈qp\approx q)。 (b) MATH-500 上的质量与吞吐量:I-DLM-8B 与 Qwen3-8B(思考)AR 性能相匹配,同时实现比 LLaDA-2.1-mini (16B) 高 3.1 倍\倍的吞吐量和+11.8 点,比 SDAR (8B) 高 4.0 倍\倍的吞吐量。