论文

分层语言模型的动态多字节预测

Dynamic Multi-Byte Prediction With Hierarchical Language Models

模型推理推理加速

摘要

字节级分层语言模型(LM)近来成为广为使用的子词分词模型之外的一种稳健替代方案。然而,一次只生成一个字节仍是推理速度的瓶颈。为此,我们提出多字节预测(MBP),并行生成多个字节,在性能影响极小且不增加参数的前提下加速推理。MBP建立在流行的多token预测(MTP)范式之上,并有两项关键创新。首先,我们引入与分层语言模型的潜在token(即分段)对齐的可变长度预测窗口。其次,我们实现了一种新颖的注意力掩码方案,在不违反因果性的前提下实现并行字节预测。我们证明多字节预测在多项生成任务——指令跟随、问答、摘要与机器翻译——上达成了帕累托最优的权衡,取得了性能与推理吞吐量之间的最佳平衡。

分层语言模型的动态多字节预测:论文配图
图1:MBP 架构概览。输入字节序列首先由模型处理,MBP 头使用 LCA 掩码(图2)从单个头并行预测多个未来字节。彩色条带表示学习到的分段边界。图中若干部分的详细描述见附录A。