论文

字节语言模型:缩放、紧急抽象和信息分配

Byte Language Models: Scaling, Emergent Abstractions, and Information Allocation

模型架构Transformer

摘要

无分词器的语言模型通过将文本直接建模为字节来消除固定分词器的归纳偏差,但由此产生的较长序列大大增加了计算量并消除了显式文本抽象。我们询问这种额外的计算是否有用,以及标准 Transformer 是否可以学习分词提供的抽象。我们在没有专门的分词相关架构的情况下研究 Transformer 上的这些问题。通过token叠加训练和哈希嵌入,字节 Transformer 在模型大小规模上始终优于子字 Transformer。我们进一步发现字节转换器将本地文本抽象构建为外部分词器:一组类似分段的位置用于收集本地上下文表示,并将中间层的最多 $25\%$ 限制为这些本地表示可以保留下游性能。最后,这些学习结构导致高度不均匀的生成困难,不确定性集中在局部结构边界附近;利用它们进行推测性解码会产生 $3.4\times$ ,而token比子字 Transformer 中的token更容易被接受。

字节语言模型:缩放、紧急抽象和信息分配的原论文方法或结果图
图 3:复制期间的 Byte-1B 注意力图。行表示复制的目标字节,列表示上次出现的源字节;每张地图都显示了目标到源的注意力。所有测试字符串均已删除内部空格。蓝色框表示原始词块,蓝色虚线标记其最终字节。在中间层中,注意力集中在块边界附近,并且多个后续目标字节重复关注相同的聚合位置,表明有意义的局部表示的形成。