论文
公平与效率:多语言分词器的实证研究 大语言模型
Equity with Efficiency: An Empirical Study of Tokenizers for Multilingual Large Language Models
摘要
多语言 大语言模型 (LLM) 依靠子词标记化来桥接离散文本和连续神经表示。最先进的多语言 LLM 通常使用字节级字节对编码 (BPE) 分词器,该分词器在结构上有利于高资源语言和拉丁文字。对于使用代表性不足的语言的人来说,尤其是东南亚地区的人来说,这种偏见会增加推理成本并扩大跨语言能力差距。我们首次在涵盖 11 种东南亚语言的统一基准上对公平标记器进行了系统比较。除了压缩效率和跨语言公平性的分词器级分析之外,我们还使用相同的训练数据通过受控 1.5B 参数语言 模型训练 评估下游任务性能。我们的结果表明,具有奇偶性的 BPE 位于效率-公平权衡的帕累托前沿,以具有竞争力的成本实现强大的压缩奇偶性。形态驱动的字节编码通过形态上更丰富的表示提供最佳的语义推理性能,尽管计算费用更高。 Byte Latent Transformer 在下游任务上表现不佳,可能是因为其架构假设与有限的低资源训练数据的约束不一致。总之,我们的研究结果表明,跨语言公平性和标记化效率从根本上来说并不矛盾,并为设计公平的多语言模型提供了实用指导。