论文
Sigma:大规模连续扩散语言模型
Large Language Continuous Diffusion Models
摘要
尽管离散扩散语言模型(dLM)在快速并行解码上成功,其非光滑高维空间阻碍了面向推理与推理加速的轨迹引导。为此我们提出Sigma,首个大规模(3B/8B)连续dLM,建立在可引导的低维ODE/SDE潜轨迹上。经似然优化逐块训练,Sigma在联合去噪高斯污染token嵌入的同时学习最优嵌入几何;为加速训练,Sigma利用AR模型预训练权重热启动。推理中我们识别出无分类器引导与分数温度对高保真推理与编码必不可少。在与SOTA离散对手(掩码dLM与AR基线)的全面数学推理与编码评估中,Sigma预训练后在GSM8K、Minerva、HumanEval、MBPP等标准基准上与离散模型具竞争力,监督微调后在MATH-500、AIME等挑战推理任务上同样具竞争力。除性能持平外,我们发现连续dLM独有的关键结构性质:(i)嵌入空间引导有效治理质量-多样性权衡,带来强pass@k;(ii)连续轨迹支持低NFE的优雅降级与高效蒸馏。这些确立了连续dLM作为高效语言生成的有前途范式。