论文
快速字节潜在 Transformer
Fast Byte Latent Transformer
摘要
最近的字节级语言模型 (LM) 与 词元级 模型的性能相匹配,而不依赖于子词词汇表,但它们的实用性受到缓慢的逐字节自回归生成的限制。我们通过新的训练和生成技术解决了 Byte Latent Transformer (BLT) 中的这一瓶颈。首先,我们介绍 BLT 扩散 (BLT-D),这是一种新模型,也是我们最快的 BLT 变体,它使用辅助分块扩散目标以及标准下一个字节预测损失进行训练。这使得推理过程能够在每个解码步骤并行生成多个字节,从而大大减少生成序列所需的前向传递的数量。其次,我们提出了受 推测解码 启发的两个扩展,它们以部分速度换取更高的生成质量:BLT 自推测 (BLT-S),其中 BLT 的本地解码器继续生成超过其正常补丁边界的草稿字节,然后使用单个全模型前向传递进行验证; BLT 扩散+验证 (BLT-DV),它在基于扩散的生成之后通过自回归验证步骤增强了 BLT-D。在生成任务中,所有方法都可以实现比 BLT 低 50% 以上的估计内存带宽成本。每种方法都有其独特的优势,共同消除了字节级 LM 实际使用的关键障碍。