论文

BitLM:通过按位连续扩散解锁多词元语言生成

BitLM: Unlocking Multi-Token Language Generation with Bitwise Continuous Diffusion

模型架构混合架构

摘要

自回归语言模型一次生成一个标记的文本,而自然语言本质上是由多标记单元构成的,包括短语、n-gram 和共同承载含义的搭配。这一单词元瓶颈限制了 预训练 期间模型的表达能力及其在推理时的吞吐量。现有的补救措施(例如 推测解码 或基于扩散的语言模型)要么完好无损地保留潜在瓶颈,要么牺牲对语言建模至关重要的因果结构。我们提出了 BitLM,一种语言模型,它将每个词元表示为固定长度的二进制代码,并采用轻量级扩散头对每个块内的多个词元并行进行去噪。至关重要的是,BitLM 保留了跨块的从左到右的因果注意力,同时在每个块内做出联合词汇决策,将自回归建模的可靠性与迭代细化的并行性相结合。通过用按位去噪替换大词汇量的 softmax,BitLM 将词元生成重新构建为紧凑二进制空间中的迭代承诺,从而实现更高效的 预训练 和更快的推理,而无需改变使语言模型有效的因果基础。我们的结果表明,一次一个词元范式不是一项基本要求,而是一种接口选择,并且改变它可以产生更强大、更快的语言模型。我们希望 BitLM 为下一代语言模型架构指明一个有希望的方向。