论文
扩散语言模型:实验分析
Diffusion Language Models: An Experimental Analysis
摘要
大语言模型(LLM)经自回归生成革命了语言建模——在广泛任务上取得强劲性能。近期——扩散语言模型(DLM)作为替代范式涌现——经迭代去噪而非下一token预测生成文本——允许整序列并行精化。虽然众多基于扩散的架构已被提出——评估协议、数据集、推理预算与生成超参的差异使其能力难以比较、其权衡难以理解。本工作中——我们对现代DLM做系统性实验分析。具体地——我们在横跨推理、编码、翻译、知识与结构化问题求解的八个基准上评估八个SOTA DLM——同时显式考虑生成质量与计算效率。除下游评估外——我们分析关键推理时因素的影响——包括去噪步数、上下文长度、块大小与并行解掩策略——并以相同条件训练的小模型受控比较补充大规模实验。我们的分析凸显基于扩散的语言建模在不同任务、架构与推理预算下的优势与局限。我们表明DLM行为受生成时设计选择强烈影响——导致性能与计算效率间的独特权衡。总体而言——我们的研究为当代DLM的能力与部署特性提供实用洞见。