论文
LangMAP:一种语言自适应的标记化方法
LangMAP: A Language-Adaptive Approach to Tokenization
摘要
特定于语言的分词器可提高分词质量以及这些语言上模型的下游性能。然而,使用这样的分词器是有代价的:要么必须从头开始训练新模型,要么必须调整现有预训练模型的词汇。我们提出了语言自适应最大后验 (LangMAP) 标记化,这是一种将 UnigramLM 算法扩展到多语言设置的标记化方案,从单个共享词汇表生成特定于语言的标记化。值得注意的是,LangMAP 可用于从头开始训练多语言语言模型,或在不改变词汇量的情况下使预训练模型的分词器适应各种语言。虽然在训练时需要语言标签,但该算法的一个关键特征是,它可以在不了解输入语言的情况下在推理时执行特定于语言的标记化。 LangMAP 在 14 种开源分词器、9 种自然语言和 9 种编程语言中改进了形态边界对齐,并且对于所有测试的编码语言,改进了与抽象语法树 (AST) 叶边界的对齐。在 微调 实验中,结果好坏参半:LangMAP 提高了测试语言的目标语言语法可接受性 (MultiBLiMP);它的好处在知识相关任务上不太一致(Global-PIQA、Belebele)。