论文
语言模型对于跨语言的非规范标记化并不同样稳健
Language Models are not Equally Robust to Non-Canonical Tokenization across Languages
摘要
尽管给定字符串存在指数级数量的有效标记化,但语言模型对由标记化器确定性生成的单个规范序列进行操作,从而使更广泛的标记化空间在很大程度上没有特征化。在本文中,我们通过研究不同语言的非规范标记化下的语言模型的行为来研究这个被忽视的空间。对于英语,先前的工作表明,模型对于表示相同底层字符串的替代标记化在很大程度上是不变的。我们询问这种不变性是否可以推广到英语以外的其他语言。我们对涵盖不同脚本的 27 种语言进行了多语言研究,并评估了六个下游任务的替代标记化下的 LLM 行为。我们发现标记化不变性并不能泛化:模型行为在不同语言之间存在很大差异,指令调整模型的平均相对性能下降为 Llama-3.1-8B 23.7%,Qwen3-8B 11.4%,Gemma-3-12B 9.9%。标记化不变性的变化在不同语言中是系统的。具有较高标记碎片的语言对非规范标记化表现出明显更高的敏感性。我们对标记化鲁棒性的研究可以诊断模型与其标记化器的耦合程度。这些结果表明,标记化的鲁棒性并不是语言模型的普遍属性,而是强烈依赖于语言及其与标记器的交互。我们还表明,具有多标记化训练数据的 LoRA 微调 可以有效缓解标记化敏感性。仅英语上的 微调 就提高了跨语言的标记化鲁棒性,同时系统地采样各种非规范标记化实现了最强的整体性能。