论文
超越单词:面向高效语言模型的组合式分词
More Than Words: Compositional Tokenization for Efficient Language Models
摘要
语言模型以token为单位顺序处理和生成文本,分词器决定每个推理步骤覆盖多少文本。在标准分词中,短语“On the table.”通常需要四次独立预测,分别生成介词On、冠词the、名词table及标点“.”;每项占用一个序列位置并增加推理成本。我们提出CoBPE组合式分词,把这样的短语表示为词汇基础token(table)及少量可复用的表面修饰符:输入时在嵌入空间中组合,输出时联合预测。在780M和1.3B规模的受控从头预训练中,匹配训练计算量后,相较标准BPE,CoBPE将序列缩短30%,平均下游性能提高1.2分。结果表明,目前通过token序列表达的一部分内容,可以改用结构化表示建模,为提高语言模型的token效率和能力打开更广的设计空间。