论文
字节语言模型:缩放、紧急抽象和信息分配
Byte Language Models: Scaling, Emergent Abstractions, and Information Allocation
摘要
无分词器的语言模型通过将文本直接建模为字节来消除固定分词器的归纳偏差,但由此产生的较长序列大大增加了计算量并消除了显式文本抽象。我们询问这种额外的计算是否有用,以及标准 Transformer 是否可以学习分词提供的抽象。我们在没有专门的分词相关架构的情况下研究 Transformer 上的这些问题。通过token叠加训练和哈希嵌入,字节 Transformer 在模型大小规模上始终优于子字 Transformer。我们进一步发现字节转换器将本地文本抽象构建为外部分词器:一组类似分段的位置用于收集本地上下文表示,并将中间层的最多 $25\%$ 限制为这些本地表示可以保留下游性能。最后,这些学习结构导致高度不均匀的生成困难,不确定性集中在局部结构边界附近;利用它们进行推测性解码会产生 $3.4\times$ ,而token比子字 Transformer 中的token更容易被接受。
