论文

TokAlign++:通过更好的标记对齐推进词汇适应

TokAlign++: Advancing Vocabulary Adaptation via Better Token Alignment

模型训练预训练

摘要

标记化是 大语言模型 (LLM) 文本处理的基础步骤。文本必须首先被标记为标记 ID,然后将其输入到 LLM。低效的标记化会导致较长的标记 ID 序列,并会减慢 LLM 的训练和推理速度。 LLM 与 词元级 蒸馏 之间的细粒度知识迁移也会因词汇不匹配而受到阻碍。为了弥补这一差距,我们引入了一种名为 TokAlign++ 的方法,通过学习更好的标记对齐词典来提高词汇适应性能。源词汇表和目标词汇表被视为两种不同的语言,双语标记对齐词典是从单语标记表示中学习的。模型参数根据新词汇的双语词典重新排列,并逐步微调以适应。对 15 种语言的实验结果表明,我们的方法提高了多语言文本压缩率,并保留了普通模型的大部分多语言能力。只需 1k 步骤即可恢复普通模型的性能。在统一了普通模型之间的词汇表之后,词元级 蒸馏 仅用 2.35 亿个词元就显着改进了基础模型。