CoBit:使用比特流扩散的语言建模
CoBit: Language Modeling with Bitstream Diffusion
摘要
扩散语言模型(DLM)承诺并行、顺序无关的生成,但在标准基准上,它们在样本质量和多样性方面历来落后于自回归模型。最近的连续流动和扩散方法缩小了这一差距。在这项工作中,我们通过将文本建模为固定宽度二进制比特流上的连续扩散过程,进一步缩小了自回归差距。我们将生成的模型称为 CoBit(连续比特流扩散)。我们的方法将语义标记表示为模拟位序列,并使用匹配滤波器残差参数化将上下文学习与分析独立位后验分离。至关重要的是,我们采用了随机采样器,该采样器应用由熵率分布门控的朗之万型校正,将随机性集中在高信息区域,同时在其他地方保持几乎确定性。在 LM1B 上,我们的 1.3 亿参数模型使用 256 次神经功能评估 (NFE),在匹配的真实数据熵 (4.31) 下达到了 59.76 的生成困惑度 (GenPPL),优于之前的 DLM 基线并达到自回归参考。在 OpenWebText (OWT) 上,我们的采样器建立了一个新的连续 DLM Pareto 前沿,使用比之前的 1024-NFE 基线少 4 倍的步骤,在熵 5.26 下实现 GenPPL 27.06。将相同配方扩展到 462M 参数模型 (CoBit-M) 进一步改善了 130M 模型 (CoBit-S) 以及中等规模连续和离散 DLM 基线上的 OWT GenPPL 熵前沿,在熵 5.40 处达到 GenPPL 19.5,接近真实数据熵 (5.44),并在高质量区域上接近预训练的 GPT-2 介质。作为额外的好处,比特流扩散消除了标准 DLM 的 O(V) 词汇扩展瓶颈:通过语义位修补预测 O(log V) 按位 logits,它可以降低内存并提高吞吐量,这是随着词汇大小增长的可扩展范例。