论文
超越困惑:字节感知语言模型中的 UTF-8 有效性
Beyond Perplexity: UTF-8 Validity in Byte-aware Language Models
摘要
字节级标记化使语言模型能够处理任何 Unicode 输入,但模型在遇到罕见或看不见的字符时可能会生成无效的 UTF-8 序列。我们使用来自英语、日语、韩语和中文的平衡多语言语料库的 80B 个标记训练的 355M 参数模型来研究训练规模和 UTF-8 生成可靠性之间的关系。我们引入了多种评估协议,将 UTF-8 结构有效性与语言建模隔离开来。 UTF-8 有效性收敛滞后于困惑度大约两倍:困惑度在 2.1B 词元后稳定,但 UTF-8 有效性需要 4.2B 词元。在上下文无关生成中,稀有字符比常见字符具有更高的结构有效性,这表明频繁字符表示的过度专业化。通过实验,我们观察到可靠的 UTF-8 生成是一种独特的能力,需要超越困惑进行评估。